#139 · 主分类: LLM应用框架

ExtractThinker

ai document-image-analysis document-intelligence document-parsing document-processing langchain llm machine-learning nlp ocr openai pdf pdf-to-text python

ExtractThinker 是一个面向 LLM 的文档智能库,提供 ORM 风格的交互,用于灵活且强大的文档工作流。

项目最后更新:08/27/25

GitHub Stars

1.6K

Forks数量

154

贡献者数量

7

许可证

Apache-2.0

收录理由

处理扫描件里的发票号或合同日期,过去总得先跑一遍OCR,再写一堆脆弱的解析逻辑,最后还得祈祷大模型别把格式搞错。ExtractThinker把这一串麻烦事收拢成更可控的流程:你只需用Pydantic定义好想提取的字段结构,接上Tesseract或Textract这类加载器,再选一个LLM供应商来填值。它还能做文档分类,把大文件按页拆分,异步支持让长任务不会卡住整个管线。用起来不像在拼凑工具,倒更像对着文档写查询语句。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目