GitHub Stars
1.7K
Forks数量
170
贡献者数量
2
许可证
MIT
收录理由
大模型评测管线翻车的方式往往有迹可循,这个插件把作者在帮助五十多家公司、讲授AI评测课程时踩过的坑直接编码成了技能。它既可以装进Claude Code,也能配合开源的Skills CLI使用,每个技能都引导智能体完成一项具体任务:审计现有评测流程、阅读追踪日志并归类失败原因、生成多样化的合成测试输入、设计LLM-as-Judge提示词,以及用人类标注来校准评判模型。其中validate-evaluator这个技能尤其值得单独看看,它通过数据切分和偏差校正来验证LLM评判是否真的和人类标注一致,这一步很多团队都会跳过。新手可以从eval-audit入手,它会按严重程度列出问题,并推荐对应的修复技能。由于这些技能源自大量真实企业的实战教训,读起来更像实用的护栏,而不是泛泛的建议。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具