#147 · 主分类: MLOps与评测

alpaca_eval

deep-learning evaluation foundation-models instruction-following large-language-models leaderboard nlp rlhf

自动评估指令跟随语言模型的工具。经过人工验证,高质量,低成本,快速。

项目最后更新:08/09/25

GitHub Stars

2.0K

Forks数量

315

贡献者数量

83

许可证

Apache-2.0

收录理由

调校指令跟随模型的人,常被一个问题卡住:新checkpoint到底比旧版强多少?AlpacaEval给出一个又快又省的答案。把模型输出喂进去,它会拿参考模型做对照,用GPT-4等强标注器在固定指令集上算胜率,开发期间可以反复跑,不必每次花钱雇人打分。它引入的长度控制胜率,专门治那种答案越长分越高的毛病,跑出来的结果和规模大得多的Chatbot Arena众包排名高度一致。项目还附带公开榜单、预计算好的模型输出、人类偏好数据,以及定制标注器的工具,想改评判方式也能动手。可以把它当作快速逼近人类判断的代理,但高风险的发布决策,还是得自己仔细把关。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目