#157 · 主分类: 深度学习框架

GRPO-Zero

从零开始实现DeepSeek R1的GRPO算法

项目最后更新:04/18/25

GitHub Stars

1.9K

Forks数量

99

贡献者数量

1

许可证

Apache-2.0

收录理由

GRPO-Zero 从零实现了 DeepSeek 提出的 GRPO 强化学习算法,整个项目只依赖 PyTorch 和 tokenizers 库,没有引入 transformers 和 vLLM 这些常见训练栈中的重依赖。代码因此保持精简,几百行内就能看清组采样、优势归一化和逐 token 策略梯度更新的完整流程。项目在显存优化上也有实用考虑:通过把优化器状态放到 CPU,24GB 显存的 RTX 4090 也能跑训练;默认配置则面向单张 A40 设计,几小时就能看到效果。它还吸收了 DAPO 的若干改进,比如按 token 加权损失、可选去除 KL 散度,这些对想用强化学习微调小模型的工程师和研究者来说,是一个很好的起点,无论是复现 CountDown 这类推理任务,还是把训练循环改造成自己的奖励函数,都足够灵活。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目