#414 · 主分类: 计算机视觉

aster

computer-vision ocr recognition scene-text

识别自然图像中的裁剪文本。

项目最后更新:03/25/23

GitHub Stars

743

Forks数量

196

贡献者数量

3

许可证

MIT

收录理由

ASTER 是一个场景文字识别器,其核心是两阶段设计:先用空间变换网络把弯曲或倾斜的文字拉直,再由基于注意力的识别模块读取结果。这种思路在工业级 OCR 中仍有参考价值。仓库自带预训练模型和演示脚本,下载后运行 demo 就能在几分钟内看到矫正后的图像和识别输出。同时提供了标准基准数据集(如 SVT)的训练与数据准备脚本,对想搭建自己识别流程的开发者来说是一份不错的参考资料。需要注意的是,代码基于 TensorFlow r1.4 编写,在较新环境上运行可能需要自行移植。若想深入理解算法原理,README 中附有论文链接;此外社区还有一个维护中的 PyTorch 移植版本,适合实际使用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目