#181 · 主分类: 计算机视觉

AdvancedLiterateMachinery

artificial-intelligence computer-vision document document-analysis document-intelligence document-recognition document-understanding documentai end-to-end-ocr multimodal multimodal-deep-learning ocr scene-text-detection scene-text-detection-recognition scene-text-recognition text-detection text-recognition vision-language vision-language-model vision-language-transformer

针对高级识字机器的原创、创新思想和算法集合。该项目由阿里巴巴集团通义实验室语言技术实验室OCR团队维护。

项目最后更新:03/17/26

GitHub Stars

1.8K

Forks数量

197

贡献者数量

6

许可证

Apache-2.0

收录理由

阿里读光OCR团队维护的这个研究仓库,适合需要从复杂图像和文档中提取文字的开发者。里面汇集了场景文字检测与识别、文档解析、表格识别、关键信息抽取等方向的代码和论文,还提供了CC-OCR基准,用来评估大模型在真实阅读任务上的表现。实际做OCR时,往往要在专用模型和通用视觉语言模型之间做取舍,而Platypus和OmniParser等项目展示了用统一架构处理多种阅读任务的可能,对于想减少维护多套OCR系统的人来说很有参考价值。整体上这是一份研究性质的开源代码库,需要自行改造适配,而不是开箱即用的产品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目