#161 · 主分类: 推理与本地部署

cortex

infrastructure machine-learning

大规模机器学习的生产基础设施

项目最后更新:06/12/24

GitHub Stars

8.0K

Forks数量

594

贡献者数量

25

许可证

Apache-2.0

收录理由

模型训练完成之后,真正的考验是让它面对真实流量稳定服务。Cortex 正是为解决这个环节而生的。它能把 AWS EKS 集群变成一套完整的推理服务平台,同一个模型既可以作为实时接口响应请求,也可以作为异步任务处理队列中的负载,还能以一次性分布式批处理作业的形式跑完整个数据集,伸缩不再靠人工估算容量,而是根据并发请求量或队列长度自动调节。集群管理这部分也替运维省下了不少精力,CPU 和 GPU 节点的弹性伸缩、spot 实例出问题时的自动回退、放在私有 VPC 里并接入 IAM 权限控制,这些通常要占掉平台团队一周时间的杂活,都内置好了。部署集群既可以用声明式配置,也能走 Terraform provider,监控指标和日志能直接接到 Prometheus、Grafana 或 CloudWatch。有一点需要坦白讲:原作者已经不再积极维护这个项目,所以如果你打算把它作为长期技术栈的基座,得先掂量掂量。不过它的架构设计和文档完整度都相当扎实,这一点没有因停止维护而打折扣。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目