#126 · 主分类: 推理与本地部署
kvcached
elastic-kvcache
gpu-mutiplexing
gpu-sharing
inference-engine
kvcache
kvcache-optimization
kvcached
llm
llm-framework
llm-inference
llm-serving
ollama
online-offline-coserve
serverless
sglang
vllm
虚拟化弹性KV缓存,用于动态GPU共享及更多场景
项目最后更新:08/23/26
GitHub Stars
1.1K
Forks数量
133
贡献者数量
29
许可证
Apache-2.0
收录理由
跑 vLLM 或 SGLang 的团队常会遇到一个头疼的问题:流量高峰之间,GPU 往往闲着。kvcached 的思路是给 KV 缓存加一层类似操作系统虚拟内存的抽象——引擎可以提前预留虚拟显存,但只有请求真正需要时才映射物理显存。这样一来,多个模型能更灵活地共用一块 GPU,显存分配会随着突发或混合负载实时调整,而不是按每个模型的最坏情况一次性锁死。对于希望模型按需拉起、空闲即睡的部署场景,这种按需分配的方式能直接提高显存利用率,也顺带降低服务成本。它作为插件装进现有引擎环境,你可以先在自家延迟和吞吐上验证效果,再决定是否全面采用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。