#91 · 主分类: 自然语言处理与文本处理

extractous

data-pipelines docx etl etl-pipelines extraction llm machine-learning natural-language-processing nlp ocr pdf pdf-parser rag rust tika unstructured unstructured-data

快速高效的非结构化数据提取。使用Rust编写,支持多种语言的绑定。

项目最后更新:12/21/24

GitHub Stars

1.8K

Forks数量

95

贡献者数量

8

许可证

Apache-2.0

收录理由

许多RAG流水线都会在早期卡在同一个问题上:喂给模型的文档并不是现成的干净文本。Extractous用Rust核心直接解析PDF、Word、HTML等多种格式,省去了单独运行抽取服务器的麻烦,而且提供Rust和Python绑定,可以嵌进你自己的代码里直接调用。它通过一个简单API同时返回内容和元数据,需要时还能对扫描页面做OCR。README里附了基准测试,显示它比流行的unstructured-io库快大约25倍,这对那些要处理大量文档但内存预算紧张的团队很有价值。如果文档摄取是你流水线的瓶颈,这个轻量级组件值得一试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目