#181 · 主分类: 计算机视觉
AdvancedLiterateMachinery
artificial-intelligence
computer-vision
document
document-analysis
document-intelligence
document-recognition
document-understanding
documentai
end-to-end-ocr
multimodal
multimodal-deep-learning
ocr
scene-text-detection
scene-text-detection-recognition
scene-text-recognition
text-detection
text-recognition
vision-language
vision-language-model
vision-language-transformer
针对高级识字机器的原创、创新思想和算法集合。该项目由阿里巴巴集团通义实验室语言技术实验室OCR团队维护。
项目最后更新:03/17/26
GitHub Stars
1.8K
Forks数量
197
贡献者数量
6
许可证
Apache-2.0
收录理由
阿里读光OCR团队维护的这个研究仓库,适合需要从复杂图像和文档中提取文字的开发者。里面汇集了场景文字检测与识别、文档解析、表格识别、关键信息抽取等方向的代码和论文,还提供了CC-OCR基准,用来评估大模型在真实阅读任务上的表现。实际做OCR时,往往要在专用模型和通用视觉语言模型之间做取舍,而Platypus和OmniParser等项目展示了用统一架构处理多种阅读任务的可能,对于想减少维护多套OCR系统的人来说很有参考价值。整体上这是一份研究性质的开源代码库,需要自行改造适配,而不是开箱即用的产品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。