GitHub Stars
8.3K
Forks数量
1.2K
贡献者数量
167
许可证
Apache-2.0
收录理由
给大模型做强化学习后训练,通常要把训练器、采样服务和自己的奖励逻辑手动拼起来,工程量大且容易出错。slime 把这些收敛到一个代码库里:Megatron 负责高吞吐训练,SGLang 负责生成 rollout,而采样、奖励计算、环境交互都走同一条显式数据管道,不再需要在多个孤立服务之间来回搬运数据。想扩展工具调用或多智能体流程时,只需作为数据生成或奖励组件接入,训练核心不用动。这个框架支撑了 GLM-4.5 到 GLM-5.2 的发布,也兼容 Qwen、DeepSeek、Llama 系列,说明完整的训练到服务链路经受过真实规模检验。对于研究团队和平台工程师来说,与其去读抽象的设计文档,不如直接拿这个经过实战验证、结构清晰的项目作为起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。