#33 · 主分类: 深度学习框架
cutlass
用于高性能线性代数的 CUDA 模板和 Python DSL
项目最后更新:08/28/26
GitHub Stars
10.3K
Forks数量
2.1K
贡献者数量
289
许可证
Other
收录理由
在NVIDIA GPU上编写高性能GEMM内核,CUTLASS几乎是绕不开的参考实现。它把矩阵乘法拆成可复用的模块化部件——分块、数据搬运、张量核心操作——让你能直接拼装并定制自己的内核,而不是从零开始写。自2017年起,这个库就用CUDA C++模板抽象提供了大量支持,覆盖的精度类型很广:从FP32、TF32、FP16到FP8、块缩放格式、窄整数乃至二进制数据,并且横跨Volta到Blackwell的各代架构。4.0版本引入的Python DSL(先是CuTe DSL)把底层概念用更直观的方式暴露出来,编译时间大幅缩短,和深度学习框架的集成也省去了胶水代码,对不想深陷C++模板元编程的团队友好得多。做性能优化或框架开发的人想写自定义内核,这里已经把最麻烦的底层工作都做完了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。