#83 · 主分类: MLOps与评测
evalscope
一个精简且可定制的框架,用于高效的大模型(LLM、VLM、AIGC)评估和性能基准测试。
项目最后更新:08/28/26
GitHub Stars
3.3K
Forks数量
471
贡献者数量
104
许可证
Apache-2.0
收录理由
选型时判断哪个大模型或多模态模型值得上线,往往凭感觉。EvalScope 让这件事少些猜测:一条命令跑通 MMLU、GSM8K、C-Eval、AIME 等常见基准,覆盖文本、视觉、Embedding、Reranker 和 AIGC 模型。除了准确率,还提供推理压测,报告 TTFT、TPOT 等指标,WebUI 里能并排对比模型,逐条查看预测细节。做智能体或工具调用系统的团队,可用带 Docker 沙箱的多轮 AgentLoop,每一轮轨迹都被记录,模型哪里出错一目了然。它整合了 OpenCompass、VLMEvalKit 等后端,熟悉哪套就用哪套,不必从头搭。Arena 两两对战按偏好给模型排序,而非看单一总分,这种比较方式往往更贴近真实部署时的取舍。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具