#206 · 主分类: MLOps与评测

llm_training_handbook

cuda large-language-models llm nccl nlp performance python pytorch scalability troubleshooting

一个开放的方法论集合,助力大型语言模型的成功训练。

项目最后更新:02/15/24

GitHub Stars

567

Forks数量

45

贡献者数量

2

许可证

Other

收录理由

这份手册是给真正动手训练大模型的人准备的,不是装个包就能用的工具。它的价值在于那些可以直接复制粘贴的脚本和命令,专门解决训练过程中会遇到的现实问题:模型并行、吞吐量优化、张量精度与数据类型选择、超参数设置、训练不稳定,以及软硬件故障排查。当训练任务卡住、发散或崩溃时,SLURM 调度和故障排查这两部分内容最值得翻出来对照。作者还附了一份姊妹篇 playbook,如果你只想要概念层面的整体认识而不想碰命令行,可以转去那里。建议把这份手册放在手边,训练跑起来的时候随时查阅。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目