#22 · 主分类: AI云平台与PaaS

pai

ai artificial-intelligence chainer cloud cluster-management cluster-manager gpu gpu-cluster gpu-computing gpu-scheduler jupyter kubernetes machine-learning model-training on-premise pytorch resource-management scheduling tensorflow

面向AI的资源调度与集群管理

项目最后更新:08/15/26

GitHub Stars

2.7K

Forks数量

552

贡献者数量

101

许可证

MIT

收录理由

OpenPAI 为那些希望在共享 GPU 服务器集群上运行分布式 AI 训练、又不想自行拼装多种独立工具的团队,提供了一个务实的选择。它把基于 Kubernetes 的调度、感知 GPU 的任务排队,以及用于提交和监控训练任务的 Web 门户整合在一起,一个小型平台团队就能独立搭建起本地集群。训练任务可以用 PyTorch、TensorFlow 或 Chainer 编写,同时提供 REST API 支持自动化操作。需要坦诚说明的是,该项目在 v1.8.1 之后进入稳定模式,仓库目前为只读状态,因此它更适合那些希望获得一个经过验证、功能冻结的平台,而不是追求活跃上游开发的组织。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目