#156 · 主分类: 推理与本地部署
DeepSpeed-MII
MII 借助 DeepSpeed 实现低延迟和高吞吐量的推理。
项目最后更新:06/30/25
GitHub Stars
2.1K
Forks数量
192
贡献者数量
36
许可证
Apache-2.0
收录理由
DeepSpeed-MII 是 DeepSpeed 项目在推理侧的延伸,一个 Python 库,让你在自有 GPU 上直接跑大模型,不必把请求交给托管 API。它把 DeepSpeed 的推理引擎封装成简单接口,HuggingFace 模型接入后,连续批处理、阻塞式 KV 缓存、张量并行这些优化都自动生效,不用自己手工搭建。对自托管团队来说,如果看重每秒生成的 token 数或严格的响应延迟,这套方案能把你已有硬件的能力更多榨出来,无论是稠密 Transformer 还是混合专家(MoE)模型都应对自如。由于它和 DeepSpeed 训练用的是同一套底层技术栈,已经在用 DeepSpeed 做训练的团队可以顺带复用那些优化成果,无需另外引入一套独立的服务系统。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。