#55 · 主分类: 自然语言处理与文本处理
docext
document
document-analysis
document-data-extraction
document-information-extraction
extraction
llm-ocr
llms
machine-learning
nlp
ocr
ocr-benchmark
ocr-onpremise
onprem
onprem-ocr
onprem-vision
onpremise
rag
table-extraction
unstructured-data
vlms
一个本地部署、无需OCR的非结构化数据提取、Markdown转换和基准测试工具包。(https://idp-leaderboard.org/)
项目最后更新:03/17/26
GitHub Stars
2.1K
Forks数量
155
贡献者数量
10
许可证
Apache-2.0
收录理由
对于需要从发票、护照、收据和长篇幅扫描版PDF中提取结构化字段的团队,docext是一个务实的选择,它免去了搭建繁重OCR技术栈的麻烦。这套本地化工具包依托视觉语言模型,将文档和图像转换为Markdown,并能识别表格、LaTeX公式、签名、水印以及表单复选框。相同的提取流程还会输出带置信度评分的字段,这样数据库或检索系统获得的是干净、可查询的数据,而不是原始OCR文本。内置的基准测试工具还能让你在投入某个模型之前,先用自有数据对比不同模型在关键信息提取、表格解析和文档分类上的表现。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。