#160 · 主分类: 教育与研究
PaLM-rlhf-pytorch
在PaLM架构上实现RLHF(基于人类反馈的强化学习)。基本上是ChatGPT,但使用PaLM。
项目最后更新:07/27/26
GitHub Stars
7.9K
Forks数量
673
贡献者数量
5
许可证
MIT
收录理由
想弄明白ChatGPT这类系统究竟怎么训练出来、而不是只调接口的话,这个仓库把RLHF的完整链路摊开了:监督微调、奖励建模、再用PPO做策略优化,全部基于PyTorch跑在PaLM架构上。作者自己说得很清楚,这是半成品,更像一张航海图而不是造好的船,没有训练好的权重,想直接部署是不行的。它的价值在于把奖励模型和策略优化怎么咬合在一起讲得比较直观,代码本身能当教学参考来读。仓库README还顺着链接到了OpenAI官方ChatGPT博客,以及CarperAI的TRLX、LAION的Open Assistant这些开源尝试,方便对照着看。因为没有现成权重,拿来跑实验、理解原理比做生产推理更合适,想深入RLHF的话,先在这里摸清脉络,再转向更成熟的框架,是个实际的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
prompts.chat
前身为 Awesome ChatGPT Prompts。分享、发现和收集社区提示词。免费且开源——可自托管,为您的组织提供完全隐私。
JavaGuide
Java 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发
system-prompts-and-models-of-ai-tools
精选流行AI助手和编码代理的系统提示、内部工具和AI模型集合。
30-seconds-of-code
编程文章,助你提升开发技能
generative-ai-for-beginners
21节课,开始使用生成式AI构建