#4 · 主分类: 深度学习框架

nanoGPT

用于训练/微调中型GPT的最简单、最快的仓库。

项目最后更新:11/12/25

GitHub Stars

62.6K

Forks数量

10.8K

贡献者数量

37

许可证

MIT

收录理由

nanoGPT 把 GPT 训练流程精简到了只剩骨架:模型定义和训练循环各约 300 行纯 PyTorch 代码,既能在单台 8×A100 上复现 GPT-2(124M)在 OpenWebText 上的训练,也能轻松改造成自定义模型,或直接加载预训练权重做微调。项目附带的莎士比亚字符级示例,让普通 GPU 用户在三分钟左右就能跑起一个可工作的模型,对想理解训练机制或快速做实验的人来说是个很顺手的起点。需要说明的是,作者现在推荐新用户转向其继任项目 nanochat,并明确将本仓库视为已弃用的旧作,因此它更适合作为一份稳定、文档清晰的参考实现,而非持续维护的产品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目