GitHub Stars
30.9K
Forks数量
3.7K
贡献者数量
70
许可证
MIT
收录理由
大多数训练Transformer的人从未越过PyTorch的调用栈。llm.c把这一层彻底剥掉:它用纯C和CUDA实现了GPT-2与GPT-3的预训练,同时保留了一份约一千行的fp32 CPU参考实现,与更快的CUDA主线代码并列。由于这是一个真实的训练循环,可以用make构建,也能在调试器里逐步执行,它特别适合用来理解CUDA内核、混合精度以及多节点训练。对于希望复现已知模型运行、又不想引入笨重框架的团队,它提供了一个紧凑且可审计的基线;而并行的PyTorch实现则方便对照,确认C版本与熟悉的训练脚本行为一致。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。