#5 · 主分类: GPU 计算框架

tt-metal

accelerator ai cuda deepseek gpu img-gen kernels llama llm metal scale-out stable-diffusion tenstorrent video-gen

:metal: TT-NN 算子库,以及 TT-Metalium 低级内核编程模型。

项目最后更新:08/29/26

GitHub Stars

1.6K

Forks数量

616

贡献者数量

637

许可证

Apache-2.0

收录理由

Tenstorrent 的 AI 加速器并不依赖 CUDA,而本仓库恰好填补了这一空缺。它包含两层工具:TT-NN 是一个 Python 与 C++ 编写的算子库,提供了类似 PyTorch 的张量接口,上手体验熟悉;TT-Metalium 则更底层,是一种内核编程模型,让你能直接控制芯片核心,编写高度定制的代码。因此,你可以先用高层框架式写法快速搭建,遇到性能瓶颈时再下沉到裸内核做调优。仓库里还带了 Llama、Qwen、Mixtral、Whisper、Stable Diffusion 等真实模型的优化实现,并公布了在 Wormhole 与 Blackhole 板卡上的 token 吞吐数据。想评估 Tenstorrent 硬件能否支撑大模型推理或生成类任务,从这里能看到硬件的实际表现,也清楚该如何上手开发。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目