#99 · 主分类: 基础模型
SPIN
deep-learning
fine-tuning
large-language-models
self-play
自博弈微调(SPIN)的官方实现
项目最后更新:05/08/24
GitHub Stars
1.3K
Forks数量
106
贡献者数量
10
许可证
Apache-2.0
收录理由
SPIN 让一个已经做过指令微调的模型,通过和自己更早的版本“对弈”来变得更强。模型自己生成回答,然后学习区分这些回答与原始监督微调样本的差异,每一轮自我对弈都能推动策略进步,而且不需要额外标注偏好数据。对于想提升微调模型在基准测试和 MT-Bench 上表现、又不想人工收集更多偏好对的开发者来说,这提供了一条不同于 DPO 的路径。仓库里包含数据生成脚本、微调循环、每一轮迭代用的 Hugging Face 数据集和 zephyr-7b 检查点,结果可以复现;先生成再微调的两步流程,也方便换用其他基础模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。