#468 · 主分类: AI编程助手
agentic-harness-engineering
基于可观测性的框架,用于自动演化编码智能体工具链,在Terminal-Bench 2上达到84.7%的pass@1,并将GPT-5.4从69.7%提升至77.0%。
项目最后更新:08/03/26
GitHub Stars
863
Forks数量
99
贡献者数量
3
许可证
MIT
收录理由
多数人优化编程智能体时,第一反应是重新训练模型。这个项目换了一条路:模型权重完全不动,被优化的是一整套围绕它的“护栏”,包括系统提示词、工具描述与实现、中间件、技能、子智能体,乃至长期记忆。它的核心机制是可观测性。具体做法是把整副护栏拆成一个个由 git 追踪的独立文件,每次改动都能回溯;原始执行轨迹长达千万级 token,通过调试器蒸馏成分层报告,优化器只读摘要,每一步修改都基于证据,既讲得出理由,也随时可以回滚。测试结果相当能说明问题:用 GPT-5.4 跑了十轮,pass@1 从 69.7% 拉到 77.0%;换 GPT-5.5 在 Terminal-Bench 2 上拿到 84.7%。更难得的是,这套护栏直接迁移到 SWE-bench-Verified 依然有效,说明学到的不是背题,而是可复用的工程经验。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。