#362 · 主分类: 计算机视觉

parseq

computer-vision eccv eccv2022 ocr optical-character-recognition scene-text-recognition text-recognition vision-transformer

使用排列自回归序列模型的场景文本识别(ECCV 2022)

项目最后更新:05/29/24

GitHub Stars

736

Forks数量

162

贡献者数量

1

许可证

Apache-2.0

收录理由

PARSeq 是 ECCV 2022 上发表的场景文字识别模型,专门从招牌、收据、标签等真实场景的裁剪图像中读取文字。它的核心设计是一个 Transformer,仅通过切换注意力掩码就能改变解码方式,从而在单一模型内同时支持无上下文识别、上下文感知解码和迭代精化,无需额外搭配语言模型,计算开销也比同类方法更小。仓库提供了预训练权重、训练与评估脚本以及在线演示,模型已被 PaddleOCR 和 docTR 两大主流 OCR 工具库集成,作为参考实现或直接集成都很稳妥。对于对比 STR 架构的研究者,它也是一个干净、可复现的基线,适合与 ABINet、TRBA、ViTSTR 等方案进行公平比较。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目