#4 · 主分类: 计算机视觉

MinerU

ai4science document-analysis docx extract-data layout-analysis ocr parser pdf pdf-converter pdf-extractor-llm pdf-extractor-pretrain pdf-extractor-rag pdf-parser pptx python xlsx

将 PDF 和 Office 文档等复杂文档转换为 LLM 可用的 markdown/JSON,以支持您的智能体工作流。

项目最后更新:08/28/26

GitHub Stars

78.7K

Forks数量

6.6K

贡献者数量

99

许可证

Other

收录理由

MinerU 能把杂乱的 PDF、扫描页和 Office 文档转换成保留阅读顺序与结构信息的 Markdown 或 JSON。它在同一轮处理中完成版面分析、OCR 以及表格和图片的抽取,交给大模型或检索系统时,输出是真正可用的结构化数据,而不是一堆原始文本。对于搭建 RAG 后端或处理真实文件的智能体工作流,这种结构化输出能省去大量清洗工作。项目提供 Python API 和命令行工具,完全本地运行,可以无缝嵌入现有流水线,不依赖任何托管服务。项目维护活跃、社区采用广泛,作为生产环境下的文档处理方案相当可靠。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目