#187 · 主分类: 深度学习框架

LLamaTuner

chatgpt dpo llama llama3 mixtral ppo qlora qwen rlhf

轻松高效地微调大语言模型。(支持LLama、LLama2、LLama3、Qwen、Baichuan、GLM、Falcon)大模型高效量化训练+部署。

项目最后更新:01/24/25

GitHub Stars

621

Forks数量

62

贡献者数量

1

许可证

Apache-2.0

收录理由

LLamaTuner 是一套面向小显存团队的微调工具,让没有大额 GPU 预算的开发者也能把开源权重模型适配到自己的数据上。它支持 LoRA、QLoRA 和全参数训练,覆盖 Llama、Qwen、Baichuan、ChatGLM、Mistral 等主流模型,单张 8GB 显卡就能微调 7B 规模的大模型。除了指令微调,还提供持续预训练和 DPO、PPO 等偏好对齐方法,并支持 LLaVA 这类视觉语言模型的训练。配合 DeepSpeed 以及 FlashAttention、Triton 算子的自动调度,在多节点扩展训练更大模型时也能保持效率。如果你希望从数据准备、训练到与结果对话都在一套代码里完成,这个项目值得关注。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目