#77 · 主分类: 教育与研究

ml-engineering

ai debugging gpus inference large-language-models llm machine-learning machine-learning-engineering mlops network pytorch scalability slurm storage training transformers

机器学习工程开放书籍

项目最后更新:08/27/26

GitHub Stars

18.8K

Forks数量

1.2K

贡献者数量

50

许可证

Other

收录理由

这份资料不是纸上谈兵式的模型训练指南,而是作者在真实训练任务中积累下来的工作笔记。他先后参与过2022年的BLOOM-176B和2023年的IDEFICS-80B多模态模型训练,把踩过的坑、验证过的命令和排查思路都整理成了可以直接复制粘贴的脚本和工具。从硬件选型、存储与网络配置,到SLURM调度、分布式调试和推理部署,覆盖了训练大模型时最常遇到的工程问题,还附带网络吞吐测试、GPU互联检测这类实用小工具。甚至专门写了一个SKILL.md文件,让AI智能体也能学习这些操作经验。对于准备训练或微调大模型的工程师来说,这是一本可以随时翻查的实战手册,值得放在手边。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目