#123 · 主分类: MLOps与评测

waza

CLI / 框架,用于代理技能 - 创建、测试、衡量并提升技能质量与效果

项目最后更新:08/29/26

GitHub Stars

1.3K

Forks数量

79

贡献者数量

17

许可证

MIT

收录理由

当技能演示在理想路径上跑通之后,真正的问题才浮现:它能否稳定复现?Waza 正是为这个阶段而生的 Go 命令行工具。它帮你搭出规范的技能目录结构,在真实 LLM 执行环境中运行智能体测试循环,并用十一个可插拔的校验器给结果打分——涵盖代码断言、文本匹配、JSON schema、工具调用序列,以及由 LLM 自身参与的评分。测试用例用 YAML 编写,同一套评测可以轻松切换 GPT-4o、Claude 等不同模型,compare 命令能直观对比哪个模型对你的技能表现更好。本地 Web 面板展示对话记录、趋势和逐任务指标,预置的 GitHub Actions 工作流则让同样的评测在 CI 里自动跑起来。如果你在维护智能体技能或相关框架,厌倦了临时手工验证,想要一套可重复、跨模型的质检手段,这个工具相当实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目