#50 · 主分类: 深度学习框架
gpt-neox
基于Megatron和DeepSpeed库,在GPU上实现模型并行自回归变换器。
项目最后更新:06/11/26
GitHub Stars
7.5K
Forks数量
1.1K
贡献者数量
138
许可证
Apache-2.0
收录理由
EleutherAI 开发 GPT-NeoX 是为了从零预训练大规模自回归语言模型,它也是其自家 GPT-NeoX 和 GPT-J 模型背后的库。这个库把 Megatron 的张量并行与 DeepSpeed 的 ZeRO 技术融合在一起,还加入了一些 EleutherAI 自己的优化,使得研究团队或小型团队不必手动拼装各个组件,就能训练参数量达数百亿的模型。它已经在 AWS、CoreWeave 以及 Oak Ridge 的 Frontier 和 Summit 这类顶级超算上运行过,并且支持通过 Slurm、MPI 或 IBM Job Step Manager 启动任务,这对那些已经使用 HPC 或多节点集群的团队来说很有价值。维护者对于适用范围也很坦诚:这是一个训练工具,而不是推理服务器,如果要部署 GPT-NeoX 风格的模型做生产环境,他们建议用户使用 Hugging Face transformers 库。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。