#24 · 主分类: 推理与本地部署
LMCache
amd
cuda
fast
inference
kv-cache
llm
pytorch
rocm
speed
vllm
LMCache:以最快的KV缓存层加速你的大语言模型
项目最后更新:08/29/26
GitHub Stars
11.6K
Forks数量
1.8K
贡献者数量
293
许可证
Apache-2.0
收录理由
大模型服务里,重复的提示词前缀会反复消耗算力去重算键值缓存,LMCache 把这部分缓存存到 CPU 内存、本地磁盘、Redis 和对象存储里,请求之间、会话之间甚至不同的推理进程之间都能直接复用。这样一来,首字延迟明显下降,GPU 显存压力也小很多。它作为独立守护进程运行,不要求改动 vLLM 等引擎的代码,接进来就能用。对经常把同一批文档服务给大量用户,或者跑多轮智能体任务、共享上下文的团队来说,收益最直观。存储后端可以按需插拔,还提供 KV 变换接口,方便你在现有环境里先做验证,再试着搞压缩或 token 丢弃这类优化。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。