#362 · 主分类: 计算机视觉
parseq
使用排列自回归序列模型的场景文本识别(ECCV 2022)
项目最后更新:05/29/24
GitHub Stars
736
Forks数量
162
贡献者数量
1
许可证
Apache-2.0
收录理由
PARSeq 是 ECCV 2022 上发表的场景文字识别模型,专门从招牌、收据、标签等真实场景的裁剪图像中读取文字。它的核心设计是一个 Transformer,仅通过切换注意力掩码就能改变解码方式,从而在单一模型内同时支持无上下文识别、上下文感知解码和迭代精化,无需额外搭配语言模型,计算开销也比同类方法更小。仓库提供了预训练权重、训练与评估脚本以及在线演示,模型已被 PaddleOCR 和 docTR 两大主流 OCR 工具库集成,作为参考实现或直接集成都很稳妥。对于对比 STR 架构的研究者,它也是一个干净、可复现的基线,适合与 ABINet、TRBA、ViTSTR 等方案进行公平比较。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。