#166 · 主分类: 深度学习框架
Adan
Adan:自适应Nesterov动量算法,用于更快优化深度模型
项目最后更新:06/08/25
GitHub Stars
822
Forks数量
70
贡献者数量
5
许可证
Apache-2.0
收录理由
Adan 是一个可以直接替换 PyTorch 中 Adam 或 AdamW 的优化器,只需改动几行代码,原有的权重衰减和梯度裁剪设置都能保留,训练循环无需重新设计,就能获得更快的收敛速度。它实现了发表于 IEEE TPAMI 的论文中的自适应 Nesterov 动量算法,仓库同时提供标准版和融合 CUDA 版本,后者在训练大模型时能有效控制显存占用。其效果在多种架构上都有验证,从视觉 Transformer、ResNet 到 BERT、GPT-2 和 MoE 训练均有所覆盖。多个下游项目,如文本生成 3D 的 DreamFusion 和 Consistent3D,已经将 Adan 设为默认优化器。如果你愿意适当调高学习率,仓库中给出的实验配置和可复现性说明,能让你轻松测试这种加速是否同样适用于自己的模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。