#14 · 主分类: 深度学习框架

llm.c

用简单、原始的C/CUDA训练LLM

项目最后更新:06/26/25

GitHub Stars

30.9K

Forks数量

3.7K

贡献者数量

70

许可证

MIT

收录理由

大多数训练Transformer的人从未越过PyTorch的调用栈。llm.c把这一层彻底剥掉:它用纯C和CUDA实现了GPT-2与GPT-3的预训练,同时保留了一份约一千行的fp32 CPU参考实现,与更快的CUDA主线代码并列。由于这是一个真实的训练循环,可以用make构建,也能在调试器里逐步执行,它特别适合用来理解CUDA内核、混合精度以及多节点训练。对于希望复现已知模型运行、又不想引入笨重框架的团队,它提供了一个紧凑且可审计的基线;而并行的PyTorch实现则方便对照,确认C版本与熟悉的训练脚本行为一致。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目