#60 · 主分类: 推理与本地部署
llm-d
在Kubernetes上使用现代加速器实现最先进的推理性能
项目最后更新:08/29/26
GitHub Stars
4.3K
Forks数量
728
贡献者数量
192
许可证
Apache-2.0
收录理由
当LLM推理规模超出单张GPU,且你已经在Kubernetes上运行vLLM或SGLang时,llm-d充当这些模型服务器之上的编排层。它通过前缀缓存实现负载感知路由,将KV缓存卸载到CPU或磁盘,使多轮对话能维持更大的工作集,并支持prefill/decode分离及宽专家并行,适用于DeepSeek-R1这类模型。项目提供了真实基准测试,展示在NVIDIA、AMD和Intel加速器上更高的吞吐量、更低的首token延迟以及更好的集群利用率。作为CNCF沙箱项目,由Red Hat、Google Cloud、IBM Research、CoreWeave和NVIDIA共同创立,其指南和Helm charts显然面向生产环境设计。对于单GPU以上、需要SLO感知自动扩缩和多租户流量控制的团队,可以遵循well-lit path指南,无需从零调整一切。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。