#14 · 主分类: AI数据基础设施与存储

unstract

ai-agents data-engineering document-ai generative-ai idp json-extraction llm mcp-server ocr pdf-extraction prompt-engineering structured-output

基于LLM的非结构化数据提取 — 专为API部署与ETL管道工作流设计

项目最后更新:08/29/26

GitHub Stars

7.2K

Forks数量

709

贡献者数量

30

许可证

AGPL-3.0

收录理由

Unstract 直击文档自动化中最棘手的环节:从 PDF、扫描件、合同这类版式混乱的文件里,稳定地抽出可用的结构化数据。如果日常要处理大量发票、表格或报告,且这些文件的排版千变万化,项目自带的可视化工作流编辑器会很有价值——不懂编程的人也能按业务逻辑配置抽取流程,不必为每种文档单独写解析代码。底层依靠大语言模型与 OCR 技术理解版面,统一输出成 JSON,同时提供 API 和 ETL 管道接口,能直接嵌进现有的数据工程体系,而不是另起炉灶。若你的痛点是从真实业务文件中反复提取数据,建议拿自己的样本跑一遍再下结论。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目