#134 · 主分类: MLOps与评测

ClawProBench

agent benchmark evaluation harness leaderboard llm openclaw

ClawProBench 是一个以实时为先的基准测试工具,用于在 OpenClaw 运行时中评估 LLM 代理,具有确定性评分和重复试验可靠性。

项目最后更新:08/25/26

GitHub Stars

823

Forks数量

54

贡献者数量

3

许可证

Apache-2.0

收录理由

ClawProBench 解决的是一个很具体的问题:在 OpenClaw 运行时里比较智能体模型,而且是在真实执行的任务上比,不是拿静态问答集凑数。它让智能体在超过一百个场景里实时跑起来,用确定性评分来判定结果,同一任务反复跑,通过或不通过始终一致,不会出现分数忽高忽低的情况。这种稳定性正是你在把某个工作流托付给特定模型之前,最需要确认的东西。项目还公开了排行榜和 Hugging Face 数据集,你可以复现结果,也可以往套件里加自己的场景。对于要选生产用智能体模型的团队,以及想要一套透明、扎根于实际运行环境的评估方案的研究者来说,这个测试框架和它生成的结构化报告都相当实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目