#178 · 主分类: 计算机视觉

donut

computer-vision document-ai eccv-2022 multimodal-pre-trained-model nlp ocr

Donut(无需OCR的文档理解Transformer)和SynthDoG(合成文档生成器)的官方实现,ECCV 2022

项目最后更新:07/11/24

GitHub Stars

6.9K

Forks数量

565

贡献者数量

9

许可证

MIT

收录理由

常见的文档解析流程往往依赖多个独立的OCR模块,先检测和识别文字,再把结果交给版面分析或信息抽取模型,环节多、调试繁琐。Donut把这个流水线整个绕开了:它用单一的Transformer模型,直接吃进文档图像,端到端地输出结构化数据,训练过程不需要外挂任何OCR引擎。仓库里提供了用于文档分类、解析以及文档VQA的预训练权重,小团队不必自建OCR服务就能快速跑通一个可用的解析器。配套的SynthDoG还能合成贴近真实场景的训练文档,覆盖中、英、日、韩等语言,在标注数据不足时很实用。模型已经集成到Hugging Face Transformers里,后续微调和部署都能沿用熟悉的技术栈,上手成本低。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目