GitHub Stars
2.5K
Forks数量
476
贡献者数量
159
许可证
Apache-2.0
收录理由
当单张GPU已经跑不动你的vLLM负载时,这套参考栈给出了一条经过验证的集群化部署起点。它把vLLM包装进请求路由、指标看板和KV缓存卸载,让你从单实例迁到分布式部署时,大多只需执行Helm安装,而不是从头搭建一套定制工程。教程覆盖了AWS、GCP、Azure和Lambda Labs,对刚接触Kubernetes的人比较友好。作为vLLM官方的参考实现,它紧跟引擎本身的功能演进,在你决定自己写operator和路由层之前,先提供一个合理的基础配置。这是个部署框架,不是模型或应用,权重由你自行加载,自动扩缩容和监控策略也由你掌控。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。