#8 · 主分类: GPU 计算框架

TileGym

有用的内核教程、示例和技能,用于基于瓦片的GPU编程

项目最后更新:08/30/26

GitHub Stars

806

Forks数量

86

贡献者数量

45

许可证

MIT

收录理由

TileGym 是一个以可运行示例为核心的 CUDA Tile 内核学习仓库,适合想真正动手写 GPU 内核的开发者。它提供了常见深度学习算子的内核实现,并附带微基准测试,方便对比不同写法的效率;更难得的是,它把内核直接接入 Llama 3.1 和 DeepSeek V2 这类真实大模型,展示了从算子到端到端推理的完整路径。对于刚接触 tile 编程的人,这是一条循序渐进的实践路线;对于正在调优自家 LLM 推理内核的团队,它也是一份随手可查的参考。同一批算子还出现在 CUDA Tile C++、Triton 的 tile IR,以及实验性的 Julia 和 Rust 后端中,能直观看到同一种思路在不同工具链下的映射。需要注意的是,它要求较新的 NVIDIA GPU 和 CUDA 13.1 以上环境,更像一个动手内核工作坊,而不是能直接跑在旧显卡上的现成运行时。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目