#130 · 主分类: 深度学习框架

Relax

agentic-rl distributed-training grpo multi-agent multimodal post-training ray-serve reinforcement-learning rlhf

面向大规模全模态后训练的异步强化学习引擎

项目最后更新:08/31/26

GitHub Stars

582

Forks数量

143

贡献者数量

45

许可证

Apache-2.0

收录理由

面向多模态大模型的强化学习后训练,能在一个框架里同时处理文本、图像、视频和音频的端到端方案并不多见,Relax 是其中之一。它把训练和推理彻底拆开:训练侧用 Megatron-LM,推理侧用 SGLang,中间通过流式传输队列异步传递数据,而 rollout、actor、reference、advantage 等阶段各自跑在独立的 GPU 集群上,突破了传统同步强化学习循环的扩展瓶颈。框架自带 PPO、GRPO、GSPO、SAPO 以及在线策略蒸馏等实用算法,还支持以 LLM 作为评判者的奖励模式,并针对智能体多轮交互提供了损失掩码和弹性 rollout 扩缩容能力。如果你的技术栈里已经用了 Ray 和 Megatron,这个项目值得认真评估,它更像一个能上生产的工程系统,而不是停留在论文里的研究原型。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目