#145 · 主分类: 深度学习框架

BMTrain

大模型的高效训练(包括预训练和微调)

项目最后更新:07/07/26

GitHub Stars

623

Forks数量

88

贡献者数量

18

许可证

Apache-2.0

收录理由

BMTrain 面向那些需要预训练或微调数百亿参数规模模型、却不想把代码重写成分布式训练框架的团队。它把 ZeRO-2/3 风格的分片和张量并行带进 PyTorch,你仍然写普通的 nn.Module 代码,通信和计算与数据传输的重叠由工具在底层处理。上手时只需替换几个基类、包装一下 transformer 模块,然后用你熟悉的 torchrun 命令启动即可。这种轻量迁移路径对研究组和小团队很有吸引力,他们想训练大模型,但不想为此引入一个笨重的框架。项目自带 GPT-2 示例,并且能接入 OpenPrompt 和 OpenDelta,所以从零开始的预训练和微调流程都能覆盖。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目