#116 · 主分类: MLOps与评测

evals-skills

AI Evals技能,以补充课程:AI Evals For Engineers & PMs

项目最后更新:08/16/26

GitHub Stars

1.7K

Forks数量

170

贡献者数量

2

许可证

MIT

收录理由

大模型评测管线翻车的方式往往有迹可循,这个插件把作者在帮助五十多家公司、讲授AI评测课程时踩过的坑直接编码成了技能。它既可以装进Claude Code,也能配合开源的Skills CLI使用,每个技能都引导智能体完成一项具体任务:审计现有评测流程、阅读追踪日志并归类失败原因、生成多样化的合成测试输入、设计LLM-as-Judge提示词,以及用人类标注来校准评判模型。其中validate-evaluator这个技能尤其值得单独看看,它通过数据切分和偏差校正来验证LLM评判是否真的和人类标注一致,这一步很多团队都会跳过。新手可以从eval-audit入手,它会按严重程度列出问题,并推荐对应的修复技能。由于这些技能源自大量真实企业的实战教训,读起来更像实用的护栏,而不是泛泛的建议。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目