#15 · 主分类: AI云平台与PaaS

kuberay

apache deep-learning kubernetes machine-learning ray

在Kubernetes上运行Ray应用的工具包

项目最后更新:08/28/26

GitHub Stars

2.7K

Forks数量

832

贡献者数量

269

许可证

Apache-2.0

收录理由

采用Ray做分布式训练和推理的团队,常常发现自己要重复编写同一套Kubernetes底层逻辑:维护集群存活的控制器、等待资源就绪后提交任务的执行器。KubeRay这个算子把这些工作打包成了三个自定义资源定义。RayCluster负责集群的创建、删除、自动扩缩容和故障容错;RayJob会在集群就绪时自动拉起一个集群并提交任务,任务结束后还能按配置自动销毁集群;RayService则将集群与Ray Serve部署图结合,让升级过程不中断服务。如果你运营共享GPU资源池,光是任务提交这一条链路就值得一看——从提交到清理,整个流程都不需要自己写控制器逻辑。对于不想手写YAML的用户,kubectl插件也覆盖了常见的操作流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目