#178 · 主分类: 计算机视觉
donut
Donut(无需OCR的文档理解Transformer)和SynthDoG(合成文档生成器)的官方实现,ECCV 2022
项目最后更新:07/11/24
GitHub Stars
6.9K
Forks数量
565
贡献者数量
9
许可证
MIT
收录理由
常见的文档解析流程往往依赖多个独立的OCR模块,先检测和识别文字,再把结果交给版面分析或信息抽取模型,环节多、调试繁琐。Donut把这个流水线整个绕开了:它用单一的Transformer模型,直接吃进文档图像,端到端地输出结构化数据,训练过程不需要外挂任何OCR引擎。仓库里提供了用于文档分类、解析以及文档VQA的预训练权重,小团队不必自建OCR服务就能快速跑通一个可用的解析器。配套的SynthDoG还能合成贴近真实场景的训练文档,覆盖中、英、日、韩等语言,在标注数据不足时很实用。模型已经集成到Hugging Face Transformers里,后续微调和部署都能沿用熟悉的技术栈,上手成本低。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。