#134 · 主分类: MLOps与评测
ClawProBench
ClawProBench 是一个以实时为先的基准测试工具,用于在 OpenClaw 运行时中评估 LLM 代理,具有确定性评分和重复试验可靠性。
项目最后更新:08/25/26
GitHub Stars
823
Forks数量
54
贡献者数量
3
许可证
Apache-2.0
收录理由
ClawProBench 解决的是一个很具体的问题:在 OpenClaw 运行时里比较智能体模型,而且是在真实执行的任务上比,不是拿静态问答集凑数。它让智能体在超过一百个场景里实时跑起来,用确定性评分来判定结果,同一任务反复跑,通过或不通过始终一致,不会出现分数忽高忽低的情况。这种稳定性正是你在把某个工作流托付给特定模型之前,最需要确认的东西。项目还公开了排行榜和 Hugging Face 数据集,你可以复现结果,也可以往套件里加自己的场景。对于要选生产用智能体模型的团队,以及想要一套透明、扎根于实际运行环境的评估方案的研究者来说,这个测试框架和它生成的结构化报告都相当实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具