#99 · 主分类: 基础模型

SPIN

deep-learning fine-tuning large-language-models self-play

自博弈微调(SPIN)的官方实现

项目最后更新:05/08/24

GitHub Stars

1.3K

Forks数量

106

贡献者数量

10

许可证

Apache-2.0

收录理由

SPIN 让一个已经做过指令微调的模型,通过和自己更早的版本“对弈”来变得更强。模型自己生成回答,然后学习区分这些回答与原始监督微调样本的差异,每一轮自我对弈都能推动策略进步,而且不需要额外标注偏好数据。对于想提升微调模型在基准测试和 MT-Bench 上表现、又不想人工收集更多偏好对的开发者来说,这提供了一条不同于 DPO 的路径。仓库里包含数据生成脚本、微调循环、每一轮迭代用的 Hugging Face 数据集和 zephyr-7b 检查点,结果可以复现;先生成再微调的两步流程,也方便换用其他基础模型。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目