#145 · 主分类: 推理与本地部署

rotorquant

通过块对角旋转实现KV缓存压缩。优于TurboQuant:更好的PPL(6.91 vs 7.07),解码速度提升28%,预填充速度提升5.3倍,参数量减少44倍。可无缝集成到llama.cpp中。

项目最后更新:04/23/26

GitHub Stars

1.0K

Forks数量

89

贡献者数量

5

许可证

Other

收录理由

单卡跑长上下文,KV cache 常常先于算力把显存占满,因为它是随 batch 和序列长度线性增长的。RotorQuant 直接拿这个开刀:用小块对角旋转先对向量做去相关,再做标量量化,解码时反向旋转还原,从而把 K/V cache 压到约 5~10 倍,困惑度只涨一点点。它的旋转块小且互相独立,绕开了同类方法依赖的蝴蝶变换,所以解码和预填充都变快了。对 llama.cpp 用户来说,接入很省事:用补丁版编译,cache-type 参数填 iso3 或 planar3 即可,同一块卡上能跑更长的上下文或更大的 batch。这是个聚焦的优化库,不是完整服务框架,适合自己管推理、想榨干现有硬件的工程师。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目