#45 · 主分类: 深度学习框架

slime

slime 是一个用于 RL 扩展的 LLM 后训练框架。

项目最后更新:08/28/26

GitHub Stars

8.3K

Forks数量

1.2K

贡献者数量

167

许可证

Apache-2.0

收录理由

给大模型做强化学习后训练,通常要把训练器、采样服务和自己的奖励逻辑手动拼起来,工程量大且容易出错。slime 把这些收敛到一个代码库里:Megatron 负责高吞吐训练,SGLang 负责生成 rollout,而采样、奖励计算、环境交互都走同一条显式数据管道,不再需要在多个孤立服务之间来回搬运数据。想扩展工具调用或多智能体流程时,只需作为数据生成或奖励组件接入,训练核心不用动。这个框架支撑了 GLM-4.5 到 GLM-5.2 的发布,也兼容 Qwen、DeepSeek、Llama 系列,说明完整的训练到服务链路经受过真实规模检验。对于研究团队和平台工程师来说,与其去读抽象的设计文档,不如直接拿这个经过实战验证、结构清晰的项目作为起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目