#33 · 主分类: 深度学习框架

cutlass

cpp cuda deep-learning deep-learning-library gpu nvidia python

用于高性能线性代数的 CUDA 模板和 Python DSL

项目最后更新:08/28/26

GitHub Stars

10.3K

Forks数量

2.1K

贡献者数量

289

许可证

Other

收录理由

在NVIDIA GPU上编写高性能GEMM内核,CUTLASS几乎是绕不开的参考实现。它把矩阵乘法拆成可复用的模块化部件——分块、数据搬运、张量核心操作——让你能直接拼装并定制自己的内核,而不是从零开始写。自2017年起,这个库就用CUDA C++模板抽象提供了大量支持,覆盖的精度类型很广:从FP32、TF32、FP16到FP8、块缩放格式、窄整数乃至二进制数据,并且横跨Volta到Blackwell的各代架构。4.0版本引入的Python DSL(先是CuTe DSL)把底层概念用更直观的方式暴露出来,编译时间大幅缩短,和深度学习框架的集成也省去了胶水代码,对不想深陷C++模板元编程的团队友好得多。做性能优化或框架开发的人想写自定义内核,这里已经把最麻烦的底层工作都做完了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目