#139 · 主分类: LLM应用框架
ExtractThinker
ExtractThinker 是一个面向 LLM 的文档智能库,提供 ORM 风格的交互,用于灵活且强大的文档工作流。
项目最后更新:08/27/25
GitHub Stars
1.6K
Forks数量
154
贡献者数量
7
许可证
Apache-2.0
收录理由
处理扫描件里的发票号或合同日期,过去总得先跑一遍OCR,再写一堆脆弱的解析逻辑,最后还得祈祷大模型别把格式搞错。ExtractThinker把这一串麻烦事收拢成更可控的流程:你只需用Pydantic定义好想提取的字段结构,接上Tesseract或Textract这类加载器,再选一个LLM供应商来填值。它还能做文档分类,把大文件按页拆分,异步支持让长任务不会卡住整个管线。用起来不像在拼凑工具,倒更像对着文档写查询语句。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
langchain
智能体工程平台。
dify
在一个协作工作区中构建Agentic工作流、RAG管道,支持丰富的AI模型和工具。可部署在云、VPC或自托管环境,团队无需重建技术栈即可从原型走向生产。
headroom
压缩工具输出、日志、文件和RAG块,再送入LLM。编码代理减少20% token,JSON减少60-95% token,答案不变。提供库、代理、MCP服务器。
litellm
最快的、最轻量的AI网关。Rust核心,Python SDK。以OpenAI(或原生)格式调用100多种LLM API,具备成本追踪、护栏、负载均衡和日志记录 [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]
llama_index
LlamaIndex 是领先的文档代理和 OCR 平台