GitHub Stars
62.6K
Forks数量
10.8K
贡献者数量
37
许可证
MIT
收录理由
nanoGPT 把 GPT 训练流程精简到了只剩骨架:模型定义和训练循环各约 300 行纯 PyTorch 代码,既能在单台 8×A100 上复现 GPT-2(124M)在 OpenWebText 上的训练,也能轻松改造成自定义模型,或直接加载预训练权重做微调。项目附带的莎士比亚字符级示例,让普通 GPU 用户在三分钟左右就能跑起一个可工作的模型,对想理解训练机制或快速做实验的人来说是个很顺手的起点。需要说明的是,作者现在推荐新用户转向其继任项目 nanochat,并明确将本仓库视为已弃用的旧作,因此它更适合作为一份稳定、文档清晰的参考实现,而非持续维护的产品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。