#20 · 主分类: 推理与本地部署

TensorRT-LLM

blackwell cuda llm-serving moe pytorch

在NVIDIA GPU上优化和部署大语言模型,实现最先进的推理性能。

项目最后更新:08/29/26

GitHub Stars

14.5K

Forks数量

2.7K

贡献者数量

466

许可证

Other

收录理由

在NVIDIA GPU上跑大模型推理,吞吐和延迟是绕不开的硬指标,而TensorRT-LLM正是把这些指标压到极限的代表作。它让你用Python定义模型,随后自动编译成针对特定GPU代际优化的内核,这可不是实验室里的花架子,大量真实的生产服务都跑在它上面。自带的Python和C++运行时把推理调度安排得明明白白,从拿到权重到部署成能处理批量请求的服务,中间不用再拼凑额外的serving组件。多卡和多节点支持也是原生就有的,遇到前沿尺寸的模型或者流量很大的场景,这一点特别顶用。如果你正在为正经的GPU部署挑选推理引擎,这个项目必须放进基准测试清单里过一遍。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目