#423 · 主分类: 教育与研究

efficient-dl-systems

cuda deep-learning distributed-training efficient-deep-learning inference-optimization machine-learning ml-infrastructure ml-systems mlops performance-optimization pytorch

高效深度学习系统课程材料

项目最后更新:05/28/26

GitHub Stars

1.0K

Forks数量

149

贡献者数量

23

许可证

MIT

收录理由

这门开放课程聚焦深度学习系统的工程实现,由高等经济学院和Yandex数据分析学院联合讲授,全部课件以每周讲座和研讨形式公开在仓库里。内容从GPU架构和CUDA API起步,随后覆盖混合精度训练,以及借助PyTorch Profiler和Nsight Systems做性能剖析的方法。进入分布式训练部分后,All-Reduce、张量并行、流水线并行和FSDP2都有详细讲解。后半程转向服务部署与推理优化,KV缓存、连续批处理、FlashAttention、量化、投机解码等主题都配有可动手操作的练习。对于想搞清楚训练任务或推理接口为什么慢、而不只是调用哪个库函数的工程师来说,这些notebook和作业提供了具体且贴近当前实践的方案,拿过来就能跑、能改。如果你正打算搭建内部培训,研讨课和作业内容稍加整理就是现成的入门教材。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目