#70 · 主分类: 深度学习框架
EasyR1
EasyR1:基于veRL的高效、可扩展的多模态强化学习训练框架
项目最后更新:08/26/26
GitHub Stars
5.1K
Forks数量
390
贡献者数量
48
许可证
Apache-2.0
收录理由
用强化学习训练模型,往往得自己拼装采样引擎、训练器和数据管线,折腾起来很费劲。EasyR1 把这些部件整合在 veRL 基础上,既支持 GRPO,也带了 DAPO、Reinforce++ 等较新的算法,还能处理 Qwen2.5-VL 这类视觉语言模型,同时兼顾纯文本的 Llama 和 Qwen。它用混合引擎调度配合 vLLM 的 SPMD 模式,多卡跑长序列强化学习时速度不错。想复现 DeepSeek-R1 风格推理训练的团队,能直接拿它提供的算法和清晰的自定义数据格式,省去大量手写胶水代码。预置的 Docker 镜像和 LoRA 支持,让它在单机实验和大规模集群上都能用起来。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。