#15 · 主分类: AI云平台与PaaS
kuberay
在Kubernetes上运行Ray应用的工具包
项目最后更新:08/28/26
GitHub Stars
2.7K
Forks数量
832
贡献者数量
269
许可证
Apache-2.0
收录理由
采用Ray做分布式训练和推理的团队,常常发现自己要重复编写同一套Kubernetes底层逻辑:维护集群存活的控制器、等待资源就绪后提交任务的执行器。KubeRay这个算子把这些工作打包成了三个自定义资源定义。RayCluster负责集群的创建、删除、自动扩缩容和故障容错;RayJob会在集群就绪时自动拉起一个集群并提交任务,任务结束后还能按配置自动销毁集群;RayService则将集群与Ray Serve部署图结合,让升级过程不中断服务。如果你运营共享GPU资源池,光是任务提交这一条链路就值得一看——从提交到清理,整个流程都不需要自己写控制器逻辑。对于不想手写YAML的用户,kubectl插件也覆盖了常见的操作流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。