#75 · 主分类: 深度学习框架
TransformerEngine
一个在NVIDIA GPU上加速Transformer模型的库,包括在Hopper、Ada和Blackwell GPU上使用8位和4位浮点(FP8和FP4)精度,在训练和推理中提供更好的性能并降低内存占用。
项目最后更新:08/29/26
GitHub Stars
3.5K
Forks数量
814
贡献者数量
198
许可证
Apache-2.0
收录理由
Transformer Engine 是 NVIDIA 自家推出的库,专门让低精度训练在其 GPU 上变得切实可用。它直接提供 PyTorch 和 JAX 模块,用来搭建支持 FP8 的 Transformer 层;到了 Blackwell 架构上,还加入 MXFP8 和 NVFP4,从而在训练和推理中降低显存占用、提升速度,省去了混合精度通常需要手动维护缩放因子的麻烦。NVIDIA 自己的许多大语言模型和 MoE 训练任务都在用它,并且它能接入 NeMo 和 MaxText,说明这些优化确实经过大规模实战检验。在 Hopper、Ada 和 Blackwell GPU 上,融合内核以及针对 MoE、张量/序列/上下文并行等特性的支持都直接可用;框架无关的 C++ API 也让其他深度学习库能方便地加上 FP8 支持。不过它并不是开箱即用的训练工具,使用时需要在你现有的 PyTorch 或 JAX 技术栈里集成,而不是引入一套全新的工作流。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。