#160 · 主分类: 教育与研究

PaLM-rlhf-pytorch

artificial-intelligence attention-mechanisms deep-learning human-feedback reinforcement-learning transformers

在PaLM架构上实现RLHF(基于人类反馈的强化学习)。基本上是ChatGPT,但使用PaLM。

项目最后更新:07/27/26

GitHub Stars

7.9K

Forks数量

673

贡献者数量

5

许可证

MIT

收录理由

想弄明白ChatGPT这类系统究竟怎么训练出来、而不是只调接口的话,这个仓库把RLHF的完整链路摊开了:监督微调、奖励建模、再用PPO做策略优化,全部基于PyTorch跑在PaLM架构上。作者自己说得很清楚,这是半成品,更像一张航海图而不是造好的船,没有训练好的权重,想直接部署是不行的。它的价值在于把奖励模型和策略优化怎么咬合在一起讲得比较直观,代码本身能当教学参考来读。仓库README还顺着链接到了OpenAI官方ChatGPT博客,以及CarperAI的TRLX、LAION的Open Assistant这些开源尝试,方便对照着看。因为没有现成权重,拿来跑实验、理解原理比做生产推理更合适,想深入RLHF的话,先在这里摸清脉络,再转向更成熟的框架,是个实际的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目