#83 · 主分类: MLOps与评测

evalscope

evaluation llm performance rag vlm

一个精简且可定制的框架,用于高效的大模型(LLM、VLM、AIGC)评估和性能基准测试。

项目最后更新:08/28/26

GitHub Stars

3.3K

Forks数量

471

贡献者数量

104

许可证

Apache-2.0

收录理由

选型时判断哪个大模型或多模态模型值得上线,往往凭感觉。EvalScope 让这件事少些猜测:一条命令跑通 MMLU、GSM8K、C-Eval、AIME 等常见基准,覆盖文本、视觉、Embedding、Reranker 和 AIGC 模型。除了准确率,还提供推理压测,报告 TTFT、TPOT 等指标,WebUI 里能并排对比模型,逐条查看预测细节。做智能体或工具调用系统的团队,可用带 Docker 沙箱的多轮 AgentLoop,每一轮轨迹都被记录,模型哪里出错一目了然。它整合了 OpenCompass、VLMEvalKit 等后端,熟悉哪套就用哪套,不必从头搭。Arena 两两对战按偏好给模型排序,而非看单一总分,这种比较方式往往更贴近真实部署时的取舍。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目