GitHub Stars
1.9K
Forks数量
99
贡献者数量
1
许可证
Apache-2.0
收录理由
GRPO-Zero 从零实现了 DeepSeek 提出的 GRPO 强化学习算法,整个项目只依赖 PyTorch 和 tokenizers 库,没有引入 transformers 和 vLLM 这些常见训练栈中的重依赖。代码因此保持精简,几百行内就能看清组采样、优势归一化和逐 token 策略梯度更新的完整流程。项目在显存优化上也有实用考虑:通过把优化器状态放到 CPU,24GB 显存的 RTX 4090 也能跑训练;默认配置则面向单张 A40 设计,几小时就能看到效果。它还吸收了 DAPO 的若干改进,比如按 token 加权损失、可选去除 KL 散度,这些对想用强化学习微调小模型的工程师和研究者来说,是一个很好的起点,无论是复现 CountDown 这类推理任务,还是把训练循环改造成自己的奖励函数,都足够灵活。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。