#49 · 主分类: 深度学习框架

Liger-Kernel

finetuning gemma2 hacktoberfest llama llama3 llm-training llms mistral phi3 triton triton-kernels

用于LLM训练的高效Triton内核

项目最后更新:08/28/26

GitHub Stars

6.6K

Forks数量

588

贡献者数量

161

许可证

BSD-2-Clause

收录理由

在多卡环境下微调或预训练大语言模型的团队,往往会被显存和吞吐这两道坎卡住。这个项目把Transformer里最吃资源的那几层,比如RMSNorm、RoPE、SwiGLU和交叉熵计算,换成用Triton写的高效融合算子。直接替换后,同一套Hugging Face训练脚本的吞吐通常能提升大约两成,显存占用也明显下降。省下来的显存,你可以拿去拉长上下文窗口、加大batch,或者干脆在更小的卡上跑,省下租更多节点的钱。它还专门针对DPO、ORPO、SimPO这类偏好对齐损失做了优化,这些损失函数平时最容易撞上显存瓶颈。接入方式也很简单,对支持模型打一行补丁就能用,想自己拼的话也可以拿提供的模块组合,而且和Flash Attention、FSDP、DeepSpeed都能共存,不需要改动现有训练流程的结构。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目