#129 · 主分类: 推理与本地部署
kvpress
inference
kv-cache
kv-cache-compression
large-language-models
llm
long-context
python
pytorch
transformers
轻松实现LLM KV缓存压缩
项目最后更新:08/18/26
GitHub Stars
1.2K
Forks数量
172
贡献者数量
31
许可证
Apache-2.0
收录理由
Transformer 模型的键值缓存会随输入长度线性膨胀,长上下文推理因此变得非常昂贵——一份百万 token 的提示词就可能吃掉数百 GB 显存。kvpress 直接瞄准这个瓶颈,提供一组在预填充阶段压缩 KV 缓存的“press”方法,通过即插即用的 transformers pipeline 接入现有 Hugging Face 模型,无需改动推理架构就能尝试。每种方法都无需训练,并带有压缩率属性,项目还附带了对比基准和排行榜,方便你在实际部署前评估精度与速度的取舍。无论你想直接采用成熟方案,还是自己动手开发新方法,这里都是不错的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。