#62 · 主分类: MLOps与评测

harbor

evals rl-environments terminal-bench

用于评估和改进智能体的框架

项目最后更新:08/29/26

GitHub Stars

4.8K

Forks数量

1.7K

贡献者数量

297

许可证

Apache-2.0

收录理由

把智能体接进评测框架的开发者大多清楚,真正耗时的不是模型本身,而是大量胶水代码。Harbor 是 Terminal-Bench 团队推出的命令行工具,把这一整套流程压缩成一条命令:指定一个智能体(比如 Claude Code 或 OpenHands)、一个数据集(比如 Terminal-Bench-2.0 或 SWE-Bench),再设定计算资源,就能在本地 Docker 或 Daytona、Modal 等云沙箱上并行跑几百次评测。这样团队能拿到可复现的对比数据,看清模型或提示词的改动究竟如何影响任务表现。除了常规评估,它还能生成用于强化学习和微调的 rollout 轨迹。对正在构建或交付智能体的人来说,它把零散的临时测试变成了一套可重复的度量流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目