#21 · 主分类: 知识库与企业搜索

opendataloader-pdf

a11y accessibility ai bounding-box document-parsing eaa html json markdown ocr ocr-recognition pdf pdf-accessibility pdf-converter pdf-extraction pdf-parser pdf-ua rag tables tagged-pdf

面向AI就绪数据的PDF解析器。自动化PDF可访问性。开源。

项目最后更新:08/28/26

GitHub Stars

28.9K

Forks数量

2.8K

贡献者数量

28

许可证

Apache-2.0

收录理由

处理大量PDF文档时,检索管线常常卡在内容提取这一步,这个解析器正好补上这一环。它能把PDF转成Markdown、带逐元素边界框的JSON以及HTML,同时保留阅读顺序和表格结构,后续做切块和引用标注都省心。本地确定性模式处理常规文档速度很快,遇到无边框表格、扫描件、公式或图表这类复杂页面,可以切到混合模式交给AI后端,内置OCR也能应对质量较差的扫描。它还有个少见的可访问性亮点:能自动给未标记的PDF打上标签,生成屏幕阅读器可读的Tagged PDF,这对需要满足无障碍法规的场景很有价值。提供Python、Node.js和Java的SDK,还集成了LangChain,接入现有技术栈很顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目