GitHub Stars
1.3K
Forks数量
79
贡献者数量
17
许可证
MIT
收录理由
当技能演示在理想路径上跑通之后,真正的问题才浮现:它能否稳定复现?Waza 正是为这个阶段而生的 Go 命令行工具。它帮你搭出规范的技能目录结构,在真实 LLM 执行环境中运行智能体测试循环,并用十一个可插拔的校验器给结果打分——涵盖代码断言、文本匹配、JSON schema、工具调用序列,以及由 LLM 自身参与的评分。测试用例用 YAML 编写,同一套评测可以轻松切换 GPT-4o、Claude 等不同模型,compare 命令能直观对比哪个模型对你的技能表现更好。本地 Web 面板展示对话记录、趋势和逐任务指标,预置的 GitHub Actions 工作流则让同样的评测在 CI 里自动跑起来。如果你在维护智能体技能或相关框架,厌倦了临时手工验证,想要一套可重复、跨模型的质检手段,这个工具相当实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具