#157 · 主分类: 深度学习框架

PatrickStar

bert gpt nlp pretrained-models pytorch

PatrickStar 为 NLP 提供更大、更快、更环保的预训练模型,并让 AI 惠及所有人。

项目最后更新:11/18/25

GitHub Stars

772

Forks数量

59

贡献者数量

3

许可证

BSD-3-Clause

收录理由

训练大语言模型时,最常遇到的坎就是模型塞不进GPU显存,常规做法只能加卡硬扛。PatrickStar换了个思路:它是一套基于PyTorch的训练系统,通过分块内存管理模块,在GPU和CPU内存之间动态搬运模型数据,而不是像多数异构训练方案那样做静态切分。这种动态调度让它能用更少的卡跑更大的模型——作者实测用8张V100训出18B参数模型,8张A100配1TB内存训出68B,32张GPU训出175B的GPT-3。用过DeepSpeed的团队会熟悉它的配置风格,API也包着标准PyTorch训练循环,迁移现有项目不算费劲。不过它本质是带论文的研究代码,想上手得先读文档、调好chunk大小,别指望开箱即用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目