#130 · 主分类: 深度学习框架
Relax
用于大规模全模态后训练的异步强化学习引擎
项目最后更新:08/28/26
GitHub Stars
580
Forks数量
142
贡献者数量
45
许可证
Apache-2.0
收录理由
Relax 解决的是多模态大模型强化学习后训练中一个很实际的痛点:训练和 rollout 推理往往要争抢同一批 GPU 资源。它把这两类任务彻底拆开,基于 Ray Serve 的服务化架构让每个阶段都成为独立部署,Megatron-LM 负责训练,SGLang 负责推理,任何一方都能单独扩缩容或故障恢复,不会拖垮整个流水线。中间的 TransferQueue 数据流转层负责在两者之间搬运数据,使得 rollout、actor、reference 和 advantage 计算可以各自跑在独立的 GPU 集群上,互不阻塞。正是这种解耦,让它成为少数能对文本、视觉、音频做端到端 RL 后训练的开源框架,连 Qwen3-Omni 这样的全模态模型也能支持,PPO、GRPO 等算法都内置。它是一套真正的分布式系统,适合拥有大规模 GPU 基础设施、想要做异步规模化 RL 的团队,而不是用来跑快速单机实验的玩具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。