#129 · 主分类: 推理与本地部署

kvpress

inference kv-cache kv-cache-compression large-language-models llm long-context python pytorch transformers

轻松实现LLM KV缓存压缩

项目最后更新:08/18/26

GitHub Stars

1.2K

Forks数量

172

贡献者数量

31

许可证

Apache-2.0

收录理由

Transformer 模型的键值缓存会随输入长度线性膨胀,长上下文推理因此变得非常昂贵——一份百万 token 的提示词就可能吃掉数百 GB 显存。kvpress 直接瞄准这个瓶颈,提供一组在预填充阶段压缩 KV 缓存的“press”方法,通过即插即用的 transformers pipeline 接入现有 Hugging Face 模型,无需改动推理架构就能尝试。每种方法都无需训练,并带有压缩率属性,项目还附带了对比基准和排行榜,方便你在实际部署前评估精度与速度的取舍。无论你想直接采用成熟方案,还是自己动手开发新方法,这里都是不错的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目