#46 · 主分类: 推理与本地部署
serving
一个灵活、高性能的机器学习模型服务系统
项目最后更新:08/28/26
GitHub Stars
6.4K
Forks数量
2.2K
贡献者数量
247
许可证
Apache-2.0
收录理由
训练好的模型要在生产环境持续响应请求,还得保证不中断服务,TensorFlow Serving 是经过大量实战检验的选择之一。它能把保存好的模型同时通过 gRPC 和 HTTP 暴露出去,发布新版本、调整灰度权重、对实验模型做 A/B 测试,都不用改动客户端代码。系统内部用引用计数和低开销的查找表来管理多个模型及其不同版本,单次推理的延迟被压得很低,部署行为也容易预期。调度器还能把零散的推理请求攒成批次交给 GPU 联合执行,在吞吐量比单次延迟更重要的场景里很有帮助。如果你本来就在 TensorFlow 生态里干活,想找一个能替你打理模型生命周期这些琐碎环节的服务层,动手自己造轮子之前,值得先把它的设计仔细读一遍。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。