#4 · 主分类: 计算机视觉
MinerU
ai4science
document-analysis
docx
extract-data
layout-analysis
ocr
parser
pdf
pdf-converter
pdf-extractor-llm
pdf-extractor-pretrain
pdf-extractor-rag
pdf-parser
pptx
python
xlsx
将 PDF 和 Office 文档等复杂文档转换为 LLM 可用的 markdown/JSON,以支持您的智能体工作流。
项目最后更新:08/28/26
GitHub Stars
78.7K
Forks数量
6.6K
贡献者数量
99
许可证
Other
收录理由
MinerU 能把杂乱的 PDF、扫描页和 Office 文档转换成保留阅读顺序与结构信息的 Markdown 或 JSON。它在同一轮处理中完成版面分析、OCR 以及表格和图片的抽取,交给大模型或检索系统时,输出是真正可用的结构化数据,而不是一堆原始文本。对于搭建 RAG 后端或处理真实文件的智能体工作流,这种结构化输出能省去大量清洗工作。项目提供 Python API 和命令行工具,完全本地运行,可以无缝嵌入现有流水线,不依赖任何托管服务。项目维护活跃、社区采用广泛,作为生产环境下的文档处理方案相当可靠。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。