#6 · 主分类: 深度学习框架
DeepSpeed
DeepSpeed是一个深度学习优化库,使分布式训练和推理变得简单、高效和有效。
项目最后更新:08/29/26
GitHub Stars
43.0K
Forks数量
4.9K
贡献者数量
506
许可证
Apache-2.0
收录理由
当单张 GPU 不够用时,DeepSpeed 是许多大模型团队的首选库。它的 ZeRO 优化器把模型状态分散到多个设备上,原本放不下的模型也能训练;内存还是紧张时,还能卸载到 CPU 或 NVMe。同一套代码也覆盖推理:用 DeepSpeed、Megatron 或 HuggingFace 训练出的检查点,无需转换即可直接跑推理,分区、内核注入和量化都自动完成。它还针对混合专家模型和稀疏注意力做了优化,这正是参数量跨过十亿大关后训练变得有趣的地方。由于它以引擎形式接入 PyTorch,而不是另起炉灶的独立框架,现有训练代码大多能继续使用,同时获得内存和吞吐上的提升。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。