#186 · 主分类: 深度学习框架

MeZO

[NeurIPS 2023] MeZO:仅通过前向传播微调语言模型。https://arxiv.org/abs/2305.17333

项目最后更新:01/11/24

GitHub Stars

1.2K

Forks数量

89

贡献者数量

5

许可证

MIT

收录理由

微调大模型时,反向传播带来的显存开销常常成为瓶颈。MeZO 另辟蹊径,只靠前向传播就能估算梯度,从而把训练显存压到与推理相当的水平。在单张 A100 上,它能微调 300 亿参数的 OPT 模型,而用 Adam 的话大约只能跑到 27 亿参数。很多任务上,它的效果与标准微调相差无几,显存却最多能省 12 倍;如果还想进一步压缩,它也能配合 LoRA 或前缀微调使用。由于不依赖目标函数的可微性,你甚至可以直接优化准确率或 F1 这类指标。仓库里附带了论文中 RoBERTa 和 OPT 实验的独立脚本,并说明了如何把 MeZO 接入已有的 HuggingFace 代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目