#156 · 主分类: 推理与本地部署

DeepSpeed-MII

deep-learning inference pytorch

MII 借助 DeepSpeed 实现低延迟和高吞吐量的推理。

项目最后更新:06/30/25

GitHub Stars

2.1K

Forks数量

192

贡献者数量

36

许可证

Apache-2.0

收录理由

DeepSpeed-MII 是 DeepSpeed 项目在推理侧的延伸,一个 Python 库,让你在自有 GPU 上直接跑大模型,不必把请求交给托管 API。它把 DeepSpeed 的推理引擎封装成简单接口,HuggingFace 模型接入后,连续批处理、阻塞式 KV 缓存、张量并行这些优化都自动生效,不用自己手工搭建。对自托管团队来说,如果看重每秒生成的 token 数或严格的响应延迟,这套方案能把你已有硬件的能力更多榨出来,无论是稠密 Transformer 还是混合专家(MoE)模型都应对自如。由于它和 DeepSpeed 训练用的是同一套底层技术栈,已经在用 DeepSpeed 做训练的团队可以顺带复用那些优化成果,无需另外引入一套独立的服务系统。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目