#173 · 主分类: 深度学习框架

mup

deep-learning machine-learning mup mutransfer python pytorch transformers

最大更新参数化(µP)

项目最后更新:07/17/24

GitHub Stars

1.8K

Forks数量

105

贡献者数量

6

许可证

MIT

收录理由

在深度学习中,一套超参数在小模型上表现良好,换到更大规模时往往就失效了,每次扩大网络都要重新调参,既费时又容易出错。微软研究院开源的 mup 包实现了一种称为最大更新参数化的方法,通过重新设定初始化方式和学习率的缩放规则,让最优超参数在模型宽度增加时保持稳定。这样一来,训练大型 Transformer 或其他超宽网络时,可以先在小模型上调好参数,再直接应用到完整规模,省去大量反复试验。使用这个库只需对 PyTorch 模型做少量改动:换上专用的输出模块、初始化函数和优化器,再调用一行代码绑定基础形状即可。它还附带了 coord-check 工具,用来验证参数化是否正确,因为这类错误往往悄无声息,却会让训练结果失真。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目