#130 · 主分类: 深度学习框架
Relax
面向大规模全模态后训练的异步强化学习引擎
项目最后更新:08/31/26
GitHub Stars
582
Forks数量
143
贡献者数量
45
许可证
Apache-2.0
收录理由
面向多模态大模型的强化学习后训练,能在一个框架里同时处理文本、图像、视频和音频的端到端方案并不多见,Relax 是其中之一。它把训练和推理彻底拆开:训练侧用 Megatron-LM,推理侧用 SGLang,中间通过流式传输队列异步传递数据,而 rollout、actor、reference、advantage 等阶段各自跑在独立的 GPU 集群上,突破了传统同步强化学习循环的扩展瓶颈。框架自带 PPO、GRPO、GSPO、SAPO 以及在线策略蒸馏等实用算法,还支持以 LLM 作为评判者的奖励模式,并针对智能体多轮交互提供了损失掩码和弹性 rollout 扩缩容能力。如果你的技术栈里已经用了 Ray 和 Megatron,这个项目值得认真评估,它更像一个能上生产的工程系统,而不是停留在论文里的研究原型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。