#48 · 主分类: MLOps与评测
opencompass
OpenCompass是一个LLM评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude等)和100多个数据集。
项目最后更新:08/27/26
GitHub Stars
7.4K
Forks数量
854
贡献者数量
185
许可证
Apache-2.0
收录理由
选大模型时,光看厂商宣传很难判断谁更适合自己的业务,除非手里有可对比的实测数据。OpenCompass 的做法是把模型跑过一百多个数据集,覆盖常识问答、数学推理、长文本理解和代码生成等场景,让你直接看到候选模型在真实任务上的差距。它支持的模型范围很宽,既包括 Llama、Mistral、Qwen、GLM 这类开源权重,也能接 GPT-4、Claude 这样的托管 API,跨家族对比起来很顺手。如果单个准确率指标不够用,它还提供了 LLM 裁判和级联评估器,能搭建更复杂的评测流程。配置驱动的设计让团队在选型或发版前,可以重复跑出标准化结果,减少主观因素干扰。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具