#24 · 主分类: 推理与本地部署

LMCache

amd cuda fast inference kv-cache llm pytorch rocm speed vllm

LMCache:以最快的KV缓存层加速你的大语言模型

项目最后更新:08/29/26

GitHub Stars

11.6K

Forks数量

1.8K

贡献者数量

293

许可证

Apache-2.0

收录理由

大模型服务里,重复的提示词前缀会反复消耗算力去重算键值缓存,LMCache 把这部分缓存存到 CPU 内存、本地磁盘、Redis 和对象存储里,请求之间、会话之间甚至不同的推理进程之间都能直接复用。这样一来,首字延迟明显下降,GPU 显存压力也小很多。它作为独立守护进程运行,不要求改动 vLLM 等引擎的代码,接进来就能用。对经常把同一批文档服务给大量用户,或者跑多轮智能体任务、共享上下文的团队来说,收益最直观。存储后端可以按需插拔,还提供 KV 变换接口,方便你在现有环境里先做验证,再试着搞压缩或 token 丢弃这类优化。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目