#144 · 主分类: 推理与本地部署
turboquant
TurboQuant:面向LLM推理的近最优KV缓存量化(3位键,2位值),包含Triton内核与vLLM集成。
项目最后更新:03/27/26
GitHub Stars
1.7K
Forks数量
195
贡献者数量
1
许可证
GPL-3.0
收录理由
做推理服务的团队如果经常被长上下文的显存占用卡住,这个项目值得直接拿来用。TurboQuant把KV cache的键压到3比特、值压到2比特,靠Triton内核实现,然后接进vLLM,你现有的服务架构不用推倒重来。仓库里贴的基准测试显示,同样的显卡,token容量差不多翻了一倍,prefill和decode吞吐基本不掉,RTX 3090和5090上跑稠密模型和MoE模型都验证过。省下来的显存要么多开几路并发,要么单请求塞更长的文档,这正是服务大上下文时最常见的瓶颈。README里还老老实实报告了准确率影响,包括大海捞针测试的结果,所以你在把生产流量切过去之前,能自己掂量清楚这笔账。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。