#79 · 主分类: AI工具目录与精选清单

awesome-RLHF

deep-learning deep-reinforcement-learning human-feedback large-language-models reinforcement-learning rlhf

强化学习与人类反馈资源的精选列表(持续更新)

项目最后更新:05/20/26

GitHub Stars

4.4K

Forks数量

259

贡献者数量

37

许可证

Apache-2.0

收录理由

想弄明白语言模型是怎么一步步学会贴合人类偏好的,这份RLHF研究索引是个很实在的起点。它把论文按年份排好,从早期奠基工作一路排到2026年,顺着翻就能看清PPO、DPO这些方法是怎么演进的,不用自己钻进会议论文集里大海捞针。维护者还顺手收集了代码库、数据集、博客和书籍,读完理论想动手跑实验时,这些资源能省下不少找东西的功夫。开头的概览部分用大白话讲清了RLHF的核心思路,就算对强化学习没什么概念的人也能快速进入状态。做研究的学生、带项目的老师,还有想摸清对齐技术脉络的工程师,翻这份清单都能省下实实在在的时间。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目