#180 · 主分类: 深度学习框架
self-rewarding-lm-pytorch
实现来自MetaAI的Self-Rewarding Language Model中提出的训练框架
项目最后更新:04/11/24
GitHub Stars
1.4K
Forks数量
70
贡献者数量
5
许可证
MIT
收录理由
对于想复现Meta提出的自奖励语言模型论文的研究者和机器学习工程师来说,这份代码是一个相当紧凑的参考实现,省去了把论文转化为可用代码的繁琐过程。SelfRewardingTrainer打包了完整的迭代训练流程:模型先自己生成候选回答,再给这些回答打分,用这些新数据继续做SFT和DPO阶段的训练。仓库里还附带了SPIN训练器,提供另一种自我对弈式的微调路线。由于构建在x-transformers之上,你可以直接接入一个标准解码器开始试验。它更适合作为研究工具,而不是生产环境中的训练软件;不过对于探索不依赖人工标注偏好数据的对齐方法的团队,这份代码比原始研究流程容易拆解得多。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。