#126 · 主分类: 推理与本地部署

kvcached

elastic-kvcache gpu-mutiplexing gpu-sharing inference-engine kvcache kvcache-optimization kvcached llm llm-framework llm-inference llm-serving ollama online-offline-coserve serverless sglang vllm

虚拟化弹性KV缓存,用于动态GPU共享及更多场景

项目最后更新:08/23/26

GitHub Stars

1.1K

Forks数量

133

贡献者数量

29

许可证

Apache-2.0

收录理由

跑 vLLM 或 SGLang 的团队常会遇到一个头疼的问题:流量高峰之间,GPU 往往闲着。kvcached 的思路是给 KV 缓存加一层类似操作系统虚拟内存的抽象——引擎可以提前预留虚拟显存,但只有请求真正需要时才映射物理显存。这样一来,多个模型能更灵活地共用一块 GPU,显存分配会随着突发或混合负载实时调整,而不是按每个模型的最坏情况一次性锁死。对于希望模型按需拉起、空闲即睡的部署场景,这种按需分配的方式能直接提高显存利用率,也顺带降低服务成本。它作为插件装进现有引擎环境,你可以先在自家延迟和吞吐上验证效果,再决定是否全面采用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目