#6 · 主分类: 深度学习框架

DeepSpeed

billion-parameters compression data-parallelism deep-learning gpu inference machine-learning mixture-of-experts model-parallelism pipeline-parallelism pytorch trillion-parameters zero

DeepSpeed是一个深度学习优化库,使分布式训练和推理变得简单、高效和有效。

项目最后更新:08/29/26

GitHub Stars

43.0K

Forks数量

4.9K

贡献者数量

506

许可证

Apache-2.0

收录理由

当单张 GPU 不够用时,DeepSpeed 是许多大模型团队的首选库。它的 ZeRO 优化器把模型状态分散到多个设备上,原本放不下的模型也能训练;内存还是紧张时,还能卸载到 CPU 或 NVMe。同一套代码也覆盖推理:用 DeepSpeed、Megatron 或 HuggingFace 训练出的检查点,无需转换即可直接跑推理,分区、内核注入和量化都自动完成。它还针对混合专家模型和稀疏注意力做了优化,这正是参数量跨过十亿大关后训练变得有趣的地方。由于它以引擎形式接入 PyTorch,而不是另起炉灶的独立框架,现有训练代码大多能继续使用,同时获得内存和吞吐上的提升。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目