#26 · 主分类: 知识库与企业搜索

unstructured

data-pipelines deep-learning document-image-analysis document-image-processing document-parser document-parsing docx donut information-retrieval langchain llm machine-learning ml natural-language-processing nlp ocr pdf pdf-to-json pdf-to-text preprocessing

开源ETL,用于将复杂文档转换为干净、结构化的数据,供语言模型使用。

项目最后更新:08/28/26

GitHub Stars

15.4K

Forks数量

1.3K

贡献者数量

148

许可证

Apache-2.0

收录理由

多数RAG流水线在真正把问题交给模型之前,就已经在数据接入环节卡住了。这个开源项目正好填补了原始文件与向量库之间的空白,能把PDF、Word、HTML以及各种冷门格式统一转换成结构化的JSON或CSV元素。它的分区逻辑会读取文档本身的版式与层级,而不是简单粗暴地把所有内容压成纯文本,这一点在知识库由合同、手册或内部Wiki构成时尤其关键。同时它也处理了接入过程中那些不起眼却绕不开的环节,比如扫描件的OCR和按版面提取信息,保证最终用于嵌入的文本是真正可用的。这样一来,你就不必为每一种用户上传的文件类型单独编写并维护解析器了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目