#144 · 主分类: MLOps与评测

MMMU

computer-vision deep-learning deep-neural-networks evaluation foundation-models large-language-models large-multimodal-models llm llms machine-learning multimodal multimodal-deep-learning multimodal-learning multimodality natural-language-processing question-answering stem visual-question-answering

该仓库包含论文“MMMU:面向专家AGI的大规模多学科多模态理解与推理基准”的评估代码。

项目最后更新:07/28/26

GitHub Stars

593

Forks数量

56

贡献者数量

8

许可证

Apache-2.0

收录理由

MMMU 是一个面向多模态模型的高难度公开基准,特别适合那些正在训练或微调多模态模型、并希望确认模型是真正在推理而非简单匹配模式的团队。它包含约 11,500 道大学水平的题目,素材取自考试、测验和教科书,横跨六个学科领域;配图类型从图表、示意图到乐谱和化学结构,种类繁多,因此能同时考察模型的视觉感知和领域知识。仓库提供了完整的评测代码,并且从 2026 年初起公开了测试集答案,这意味着你可以直接在本地评估自己的模型,不必依赖在线排行榜。配套的 MMMU-Pro 版本增加了更难的单选题和纯视觉设置,对模型的理解能力提出更严格的检验。对于需要对比开源视觉语言模型的团队来说,这是一个实用且可复现的衡量工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目