#123 · 主分类: 推理与本地部署
kubeai
AI推理操作器,用于Kubernetes。在生产环境中服务ML模型的最简单方式。支持VLM、LLM、嵌入和语音转文本。
项目最后更新:08/24/26
GitHub Stars
1.3K
Forks数量
134
贡献者数量
35
许可证
Apache-2.0
收录理由
如果你们的团队已经在用 Kubernetes,KubeAI 能让你省去手工拼装推理栈的麻烦。它是一个 Kubernetes 操作器:你只需在 CRD 里声明一个模型,剩下的下载权重、挂载存储、按需从零扩容副本都由它接管。最出彩的是它的代理层——不像 kube-proxy 那样随机负载均衡,而是采用前缀感知路由,让 vLLM 的 KV cache 保持热度,多副本部署时吞吐和首 token 延迟都有实打实的改善。它自带一批针对常见 GPU 型号预配置好的模型,既能跑在 CPU 上,也能跑在 GPU 或 TPU 上,而且不依赖 Istio、Knative 或 Prometheus adapter。对于已经在 Kubernetes 上、想对外提供 LLM、embedding、reranking 或语音转文字服务的团队,从模型文件到可用的 OpenAI 兼容端点,这条路它帮你走完。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。