#21 · 主分类: 深度学习框架
Megatron-LM
正在进行的大规模Transformer模型训练研究
项目最后更新:08/29/26
GitHub Stars
17.7K
Forks数量
4.4K
贡献者数量
399
许可证
Other
收录理由
Megatron-LM 在分布式训练研究领域有着深厚的积累,许多前沿成果都在这套代码上得到验证。如果你正打算把大型 Transformer 模型扩展到多 GPU 环境,从这里入手会省去不少弯路。仓库里包含两部分:一是带预置脚本的参考实现,适合快速跑通实验;二是 Megatron Core,一个可组合的 GPU 优化构建块库,能让你按需拼装自己的训练框架。并行策略是它最值得关注的地方——张量、流水线、数据、专家和上下文并行,加上 FP16、BF16、FP8、FP4 混合精度,同一套代码可以从单机几卡平滑过渡到整个集群。框架开发者可以直接复用其中的 Transformer 模块和模型结构,研究团队则能借助现成示例快速建立基线。配套的 Megatron Bridge 支持与 Hugging Face 双向转换检查点,换用这套体系时不必重新训练权重,迁移成本低了不少。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。