GitHub Stars
4.8K
Forks数量
1.7K
贡献者数量
297
许可证
Apache-2.0
收录理由
把智能体接进评测框架的开发者大多清楚,真正耗时的不是模型本身,而是大量胶水代码。Harbor 是 Terminal-Bench 团队推出的命令行工具,把这一整套流程压缩成一条命令:指定一个智能体(比如 Claude Code 或 OpenHands)、一个数据集(比如 Terminal-Bench-2.0 或 SWE-Bench),再设定计算资源,就能在本地 Docker 或 Daytona、Modal 等云沙箱上并行跑几百次评测。这样团队能拿到可复现的对比数据,看清模型或提示词的改动究竟如何影响任务表现。除了常规评估,它还能生成用于强化学习和微调的 rollout 轨迹。对正在构建或交付智能体的人来说,它把零散的临时测试变成了一套可重复的度量流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具