#186 · 主分类: 深度学习框架
MeZO
[NeurIPS 2023] MeZO:仅通过前向传播微调语言模型。https://arxiv.org/abs/2305.17333
项目最后更新:01/11/24
GitHub Stars
1.2K
Forks数量
89
贡献者数量
5
许可证
MIT
收录理由
微调大模型时,反向传播带来的显存开销常常成为瓶颈。MeZO 另辟蹊径,只靠前向传播就能估算梯度,从而把训练显存压到与推理相当的水平。在单张 A100 上,它能微调 300 亿参数的 OPT 模型,而用 Adam 的话大约只能跑到 27 亿参数。很多任务上,它的效果与标准微调相差无几,显存却最多能省 12 倍;如果还想进一步压缩,它也能配合 LoRA 或前缀微调使用。由于不依赖目标函数的可微性,你甚至可以直接优化准确率或 F1 这类指标。仓库里附带了论文中 RoBERTa 和 OPT 实验的独立脚本,并说明了如何把 MeZO 接入已有的 HuggingFace 代码。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。