#21 · 主分类: 深度学习框架

Megatron-LM

large-language-models model-para transformers

正在进行的大规模Transformer模型训练研究

项目最后更新:08/29/26

GitHub Stars

17.7K

Forks数量

4.4K

贡献者数量

399

许可证

Other

收录理由

Megatron-LM 在分布式训练研究领域有着深厚的积累,许多前沿成果都在这套代码上得到验证。如果你正打算把大型 Transformer 模型扩展到多 GPU 环境,从这里入手会省去不少弯路。仓库里包含两部分:一是带预置脚本的参考实现,适合快速跑通实验;二是 Megatron Core,一个可组合的 GPU 优化构建块库,能让你按需拼装自己的训练框架。并行策略是它最值得关注的地方——张量、流水线、数据、专家和上下文并行,加上 FP16、BF16、FP8、FP4 混合精度,同一套代码可以从单机几卡平滑过渡到整个集群。框架开发者可以直接复用其中的 Transformer 模块和模型结构,研究团队则能借助现成示例快速建立基线。配套的 Megatron Bridge 支持与 Hugging Face 双向转换检查点,换用这套体系时不必重新训练权重,迁移成本低了不少。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目