#173 · 主分类: 深度学习框架
mup
deep-learning
machine-learning
mup
mutransfer
python
pytorch
transformers
最大更新参数化(µP)
项目最后更新:07/17/24
GitHub Stars
1.8K
Forks数量
105
贡献者数量
6
许可证
MIT
收录理由
在深度学习中,一套超参数在小模型上表现良好,换到更大规模时往往就失效了,每次扩大网络都要重新调参,既费时又容易出错。微软研究院开源的 mup 包实现了一种称为最大更新参数化的方法,通过重新设定初始化方式和学习率的缩放规则,让最优超参数在模型宽度增加时保持稳定。这样一来,训练大型 Transformer 或其他超宽网络时,可以先在小模型上调好参数,再直接应用到完整规模,省去大量反复试验。使用这个库只需对 PyTorch 模型做少量改动:换上专用的输出模块、初始化函数和优化器,再调用一行代码绑定基础形状即可。它还附带了 coord-check 工具,用来验证参数化是否正确,因为这类错误往往悄无声息,却会让训练结果失真。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。