#26 · 主分类: 知识库与企业搜索
unstructured
开源ETL,用于将复杂文档转换为干净、结构化的数据,供语言模型使用。
项目最后更新:08/28/26
GitHub Stars
15.4K
Forks数量
1.3K
贡献者数量
148
许可证
Apache-2.0
收录理由
多数RAG流水线在真正把问题交给模型之前,就已经在数据接入环节卡住了。这个开源项目正好填补了原始文件与向量库之间的空白,能把PDF、Word、HTML以及各种冷门格式统一转换成结构化的JSON或CSV元素。它的分区逻辑会读取文档本身的版式与层级,而不是简单粗暴地把所有内容压成纯文本,这一点在知识库由合同、手册或内部Wiki构成时尤其关键。同时它也处理了接入过程中那些不起眼却绕不开的环节,比如扫描件的OCR和按版面提取信息,保证最终用于嵌入的文本是真正可用的。这样一来,你就不必为每一种用户上传的文件类型单独编写并维护解析器了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。