#220 · 主分类: 教育与研究

hands-on-modern-rl

agent agentic agentic-ai agentic-rl dpo grpo llm llm-alignment ppo pytorch reinforcement reinforcement-learning rl rlhf sft tutorial

🚀 一个开源、动手实践的课程,弥合从基础RL概念到LLM对齐、RLVR和高级Agentic系统之间的差距。

项目最后更新:08/28/26

GitHub Stars

4.1K

Forks数量

300

贡献者数量

23

许可证

Other

收录理由

这份开源课程面向日常交付机器学习模型、却对 PPO、DPO、GRPO 训练细节只有模糊概念的工程师。内容以动手实践为主线,从强化学习基础一路延伸到 LLM 后训练、RLVR 和智能体系统。每个知识点都配有可运行的实验代码,并用逐行代码图把公式和可编辑的训练循环对应起来,读代码时能直接看到数学怎么落地。课程以在线形式公开,也提供 PDF 下载,团队可以按自己的节奏推进,带新人时也能直接丢一个链接过去。如果你刚接触对齐或 RLVR,还没决定用哪个框架,先在这里把直觉建立起来会很划算。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目