#68 · 主分类: 基础模型

mPLUG-DocOwl

chart-understanding document-understanding mllm multimodal multimodal-large-language-models table-understanding

mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型

项目最后更新:05/30/25

GitHub Stars

2.4K

Forks数量

154

贡献者数量

8

许可证

Apache-2.0

收录理由

mPLUG-DocOwl 是阿里巴巴开源的系列多模态语言模型,专门面向文档理解场景,无需额外接入 OCR 流程即可直接读取扫描件、合同、发票、表格和图表中的信息并回答问题。对做文档问答或数据抽取的团队来说,能直接从页面图像得到结构化答案,是反复选用它的主要原因。仓库里汇集了多个模型版本的权重,包括轻量的图表专用型号和面向多页文档的版本,同时附带了推理、评估和训练代码,方便直接运行或二次开发。项目还公开了训练数据集和微调方法,意味着你可以基于自有文档语料做定制训练,而不只是拿现成模型跑一跑。研究者也能找到各版本对应的论文和复现的基准数据。如果你需要把排版复杂、视觉信息密集的文档转化成可用的答案,这个项目是很好的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目