#55 · 主分类: 自然语言处理与文本处理

docext

document document-analysis document-data-extraction document-information-extraction extraction llm-ocr llms machine-learning nlp ocr ocr-benchmark ocr-onpremise onprem onprem-ocr onprem-vision onpremise rag table-extraction unstructured-data vlms

一个本地部署、无需OCR的非结构化数据提取、Markdown转换和基准测试工具包。(https://idp-leaderboard.org/)

项目最后更新:03/17/26

GitHub Stars

2.1K

Forks数量

155

贡献者数量

10

许可证

Apache-2.0

收录理由

对于需要从发票、护照、收据和长篇幅扫描版PDF中提取结构化字段的团队,docext是一个务实的选择,它免去了搭建繁重OCR技术栈的麻烦。这套本地化工具包依托视觉语言模型,将文档和图像转换为Markdown,并能识别表格、LaTeX公式、签名、水印以及表单复选框。相同的提取流程还会输出带置信度评分的字段,这样数据库或检索系统获得的是干净、可查询的数据,而不是原始OCR文本。内置的基准测试工具还能让你在投入某个模型之前,先用自有数据对比不同模型在关键信息提取、表格解析和文档分类上的表现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目