#21 · 主分类: 知识库与企业搜索
opendataloader-pdf
面向AI就绪数据的PDF解析器。自动化PDF可访问性。开源。
项目最后更新:08/28/26
GitHub Stars
28.9K
Forks数量
2.8K
贡献者数量
28
许可证
Apache-2.0
收录理由
处理大量PDF文档时,检索管线常常卡在内容提取这一步,这个解析器正好补上这一环。它能把PDF转成Markdown、带逐元素边界框的JSON以及HTML,同时保留阅读顺序和表格结构,后续做切块和引用标注都省心。本地确定性模式处理常规文档速度很快,遇到无边框表格、扫描件、公式或图表这类复杂页面,可以切到混合模式交给AI后端,内置OCR也能应对质量较差的扫描。它还有个少见的可访问性亮点:能自动给未标记的PDF打上标签,生成屏幕阅读器可读的Tagged PDF,这对需要满足无障碍法规的场景很有价值。提供Python、Node.js和Java的SDK,还集成了LangChain,接入现有技术栈很顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。