#49 · 主分类: 深度学习框架
Liger-Kernel
用于LLM训练的高效Triton内核
项目最后更新:08/28/26
GitHub Stars
6.6K
Forks数量
588
贡献者数量
161
许可证
BSD-2-Clause
收录理由
在多卡环境下微调或预训练大语言模型的团队,往往会被显存和吞吐这两道坎卡住。这个项目把Transformer里最吃资源的那几层,比如RMSNorm、RoPE、SwiGLU和交叉熵计算,换成用Triton写的高效融合算子。直接替换后,同一套Hugging Face训练脚本的吞吐通常能提升大约两成,显存占用也明显下降。省下来的显存,你可以拿去拉长上下文窗口、加大batch,或者干脆在更小的卡上跑,省下租更多节点的钱。它还专门针对DPO、ORPO、SimPO这类偏好对齐损失做了优化,这些损失函数平时最容易撞上显存瓶颈。接入方式也很简单,对支持模型打一行补丁就能用,想自己拼的话也可以拿提供的模块组合,而且和Flash Attention、FSDP、DeepSpeed都能共存,不需要改动现有训练流程的结构。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。