#144 · 主分类: MLOps与评测
MMMU
该仓库包含论文“MMMU:面向专家AGI的大规模多学科多模态理解与推理基准”的评估代码。
项目最后更新:07/28/26
GitHub Stars
593
Forks数量
56
贡献者数量
8
许可证
Apache-2.0
收录理由
MMMU 是一个面向多模态模型的高难度公开基准,特别适合那些正在训练或微调多模态模型、并希望确认模型是真正在推理而非简单匹配模式的团队。它包含约 11,500 道大学水平的题目,素材取自考试、测验和教科书,横跨六个学科领域;配图类型从图表、示意图到乐谱和化学结构,种类繁多,因此能同时考察模型的视觉感知和领域知识。仓库提供了完整的评测代码,并且从 2026 年初起公开了测试集答案,这意味着你可以直接在本地评估自己的模型,不必依赖在线排行榜。配套的 MMMU-Pro 版本增加了更难的单选题和纯视觉设置,对模型的理解能力提出更严格的检验。对于需要对比开源视觉语言模型的团队来说,这是一个实用且可复现的衡量工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具