#82 · 主分类: 推理与本地部署

production-stack

vLLM 的参考系统,用于 K8S 原生集群级部署,并带有社区驱动的性能优化

项目最后更新:08/29/26

GitHub Stars

2.5K

Forks数量

476

贡献者数量

159

许可证

Apache-2.0

收录理由

当单张GPU已经跑不动你的vLLM负载时,这套参考栈给出了一条经过验证的集群化部署起点。它把vLLM包装进请求路由、指标看板和KV缓存卸载,让你从单实例迁到分布式部署时,大多只需执行Helm安装,而不是从头搭建一套定制工程。教程覆盖了AWS、GCP、Azure和Lambda Labs,对刚接触Kubernetes的人比较友好。作为vLLM官方的参考实现,它紧跟引擎本身的功能演进,在你决定自己写operator和路由层之前,先提供一个合理的基础配置。这是个部署框架,不是模型或应用,权重由你自行加载,自动扩缩容和监控策略也由你掌控。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目