#202 · 主分类: MLOps与评测
Multi-Modality-Arena
聊天机器人竞技场遇上多模态!多模态竞技场允许你并排基准测试视觉语言模型,同时提供图像作为输入。支持MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2等更多模型!
项目最后更新:04/21/24
GitHub Stars
566
Forks数量
39
贡献者数量
10
许可证
Other
收录理由
视觉语言模型的公平对比并不容易,这个项目直接回应了这种痛点。它借鉴了Chatbot Arena的思路,在视觉问答任务上让两个匿名模型并排接受同一组图像输入,由真人投票选出更优者,从而收集人类偏好数据。仓库里还附带完整的评测代码和数据集:LVLM-eHub覆盖了数十个多模态能力数据集,另有面向医学影像的VQA基准,以及公开分数的排行榜。无论你想快速验证一个新模型的相对水平,还是打算搭建自己的评测流程,这里都能提供现成的参考和起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具