#158 · 主分类: 推理与本地部署

vllm-turboquant

vLLM TurboQuant

项目最后更新:06/25/26

GitHub Stars

616

Forks数量

103

贡献者数量

2

许可证

Apache-2.0

收录理由

这个项目针对的是长上下文场景下vLLM服务频繁触碰显存上限的痛点。它在vLLM基础上加入了TurboQuant KV缓存量化,把注意力层的键值缓存压缩后,同样的GPU就能塞下更长的序列或更大的批次。具体效果有明确数据:比如FP8键加4位值的预设组合,能带来约2.6倍的缓存压缩,而困惑度损失很小;量化器的配置也完全开放,位宽和归一化修正都可以自己调。由于它紧密跟随上游vLLM,你熟悉的连续批处理、PagedAttention、OpenAI兼容API这些标准服务能力都保留着,只是额外多了一层量化。如果你已经在跑vLLM,想在买新卡之前从现有硬件里多榨出一些上下文长度或吞吐量,这个仓库是个很聚焦的试验场。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目