#20 · 主分类: 推理与本地部署
TensorRT-LLM
blackwell
cuda
llm-serving
moe
pytorch
在NVIDIA GPU上优化和部署大语言模型,实现最先进的推理性能。
项目最后更新:08/29/26
GitHub Stars
14.5K
Forks数量
2.7K
贡献者数量
466
许可证
Other
收录理由
在NVIDIA GPU上跑大模型推理,吞吐和延迟是绕不开的硬指标,而TensorRT-LLM正是把这些指标压到极限的代表作。它让你用Python定义模型,随后自动编译成针对特定GPU代际优化的内核,这可不是实验室里的花架子,大量真实的生产服务都跑在它上面。自带的Python和C++运行时把推理调度安排得明明白白,从拿到权重到部署成能处理批量请求的服务,中间不用再拼凑额外的serving组件。多卡和多节点支持也是原生就有的,遇到前沿尺寸的模型或者流量很大的场景,这一点特别顶用。如果你正在为正经的GPU部署挑选推理引擎,这个项目必须放进基准测试清单里过一遍。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。