#5 · 主分类: 计算机视觉

tesseract

hacktoberfest lstm machine-learning ocr ocr-engine tesseract tesseract-ocr

Tesseract开源OCR引擎(主仓库)

项目最后更新:08/25/26

GitHub Stars

76.2K

Forks数量

10.8K

贡献者数量

241

许可证

Apache-2.0

收录理由

提起开源OCR,大多数人首先想到的就是Tesseract。它作为开放源代码的事实标准已经超过十年,既提供命令行工具,也提供C/C++库,既能快速处理单张图片,也能嵌入到大型文档处理流程中。当前版本基于LSTM神经网络进行行识别,同时保留传统引擎模式以保证兼容性,开箱即可识别一百多种语言,也支持训练新语言。输出格式涵盖纯文本、hOCR、PDF、TSV、ALTO和PAGE,方便下游搜索、索引或数据抽取系统直接使用。做文档数字化、票据解析或档案整理工作的团队,都能从这套稳定且文档完善的工具链中获益,而且它拥有多种编程语言的绑定。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目