GitHub Stars
806
Forks数量
86
贡献者数量
45
许可证
MIT
收录理由
TileGym 是一个以可运行示例为核心的 CUDA Tile 内核学习仓库,适合想真正动手写 GPU 内核的开发者。它提供了常见深度学习算子的内核实现,并附带微基准测试,方便对比不同写法的效率;更难得的是,它把内核直接接入 Llama 3.1 和 DeepSeek V2 这类真实大模型,展示了从算子到端到端推理的完整路径。对于刚接触 tile 编程的人,这是一条循序渐进的实践路线;对于正在调优自家 LLM 推理内核的团队,它也是一份随手可查的参考。同一批算子还出现在 CUDA Tile C++、Triton 的 tile IR,以及实验性的 Julia 和 Rust 后端中,能直观看到同一种思路在不同工具链下的映射。需要注意的是,它要求较新的 NVIDIA GPU 和 CUDA 13.1 以上环境,更像一个动手内核工作坊,而不是能直接跑在旧显卡上的现成运行时。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
kompute
基于Vulkan的通用GPU计算框架,支持数千种跨厂商显卡(AMD、高通、NVIDIA等)。极速、支持移动端、异步,并针对高级GPU数据处理场景优化。由Linux基金会支持。
lupine
LUPINE 是一种基于 IP 的 GPU 桥接技术,可将远程 GPU 挂载到仅 CPU 的机器上。
dstack
供应商无关的编排,支持训练、推理和代理工作负载,适用于 NVIDIA、AMD、TPU、Tenstorrent,可在云、Kubernetes 和裸金属上运行。
tt-metal
:metal: TT-NN 算子库,以及 TT-Metalium 低级内核编程模型。
MetalPetal
基于Metal构建的GPU加速图像和视频处理框架。