#91 · 主分类: 自然语言处理与文本处理
extractous
data-pipelines
docx
etl
etl-pipelines
extraction
llm
machine-learning
natural-language-processing
nlp
ocr
pdf
pdf-parser
rag
rust
tika
unstructured
unstructured-data
快速高效的非结构化数据提取。使用Rust编写,支持多种语言的绑定。
项目最后更新:12/21/24
GitHub Stars
1.8K
Forks数量
95
贡献者数量
8
许可证
Apache-2.0
收录理由
许多RAG流水线都会在早期卡在同一个问题上:喂给模型的文档并不是现成的干净文本。Extractous用Rust核心直接解析PDF、Word、HTML等多种格式,省去了单独运行抽取服务器的麻烦,而且提供Rust和Python绑定,可以嵌进你自己的代码里直接调用。它通过一个简单API同时返回内容和元数据,需要时还能对扫描页面做OCR。README里附了基准测试,显示它比流行的unstructured-io库快大约25倍,这对那些要处理大量文档但内存预算紧张的团队很有价值。如果文档摄取是你流水线的瓶颈,这个轻量级组件值得一试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。