#4 · 主分类: 知识库与企业搜索
docling
为生成式AI准备文档
项目最后更新:08/28/26
GitHub Stars
65.7K
Forks数量
4.7K
贡献者数量
289
许可证
MIT
收录理由
Docling 是一个文档解析库,专门处理现实中常见的文件格式,包括 PDF、DOCX、PPTX、XLSX、HTML、EPUB,甚至音频和视频。它把这些格式统一转换成结构化的文档模型,并支持导出为 Markdown、HTML 或无损 JSON。转换过程中,阅读顺序、表格结构、版面布局和公式都能保留下来,这意味着你喂给向量数据库或智能体的不是一堆扁平的文本,而是真正有结构的内容。对于处理敏感数据或处于隔离环境的场景,它可以在本地运行,还内置了 OCR 来识别扫描页面。同时,它提供了与 LangChain、LlamaIndex 和 Haystack 的现成集成,省去大量胶水代码。团队在构建知识库、文档问答或基于真实文件的智能体工作流时,这种结构化输出往往决定了流水线是能顺畅运转,还是需要不断清理数据。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。
meilisearch
一个极速搜索引擎API,为您的网站和应用带来AI驱动的混合搜索。