#147 · 主分类: 推理与本地部署

ome

deepseek k8s kimi-k2 llama llm llm-inference model-as-a-service model-serving multi-node-kubernetes oracle-cloud pd-disaggregation qwen sglang vllm

开放模型引擎(OME)——用于LLM服务、GPU调度和模型生命周期管理的Kubernetes操作器。支持SGLang、vLLM、TensorRT-LLM和Triton。

项目最后更新:09/01/26

GitHub Stars

502

Forks数量

94

贡献者数量

39

许可证

Apache-2.0

收录理由

OME 是一个 Kubernetes 算子,专门接管 LLM 服务的运维环节,让团队不必再维护一堆手工编写的部署脚本。模型在 OME 中是头等公民的自定义资源:算子会直接从模型文件解析出架构、参数量和能力,然后对 SGLang、vLLM、TensorRT-LLM、Triton 等运行时进行评分,挑出合适的匹配。生产环境里容易踩坑的部分它也一并处理,包括 GPU 装箱调度并支持动态重新优化、prefill-decode 分离、多节点推理,以及金丝雀或蓝绿发布。与 Kueue、KEDA 和 Gateway API 的集成分别覆盖了 gang 调度、自动扩缩容和流量路由,BenchmarkJob 资源则用于负载测试。如果你运营 GPU 集群,想要一个能从模型下载、服务部署到性能评估全流程管理的控制面,OME 值得一看。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目