#48 · 主分类: MLOps与评测

opencompass

benchmark chatgpt evaluation large-language-model llama2 llama3 llm openai

OpenCompass是一个LLM评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude等)和100多个数据集。

项目最后更新:08/27/26

GitHub Stars

7.4K

Forks数量

854

贡献者数量

185

许可证

Apache-2.0

收录理由

选大模型时,光看厂商宣传很难判断谁更适合自己的业务,除非手里有可对比的实测数据。OpenCompass 的做法是把模型跑过一百多个数据集,覆盖常识问答、数学推理、长文本理解和代码生成等场景,让你直接看到候选模型在真实任务上的差距。它支持的模型范围很宽,既包括 Llama、Mistral、Qwen、GLM 这类开源权重,也能接 GPT-4、Claude 这样的托管 API,跨家族对比起来很顺手。如果单个准确率指标不够用,它还提供了 LLM 裁判和级联评估器,能搭建更复杂的评测流程。配置驱动的设计让团队在选型或发版前,可以重复跑出标准化结果,减少主观因素干扰。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目