GitHub Stars
616
Forks数量
103
贡献者数量
2
许可证
Apache-2.0
收录理由
这个项目针对的是长上下文场景下vLLM服务频繁触碰显存上限的痛点。它在vLLM基础上加入了TurboQuant KV缓存量化,把注意力层的键值缓存压缩后,同样的GPU就能塞下更长的序列或更大的批次。具体效果有明确数据:比如FP8键加4位值的预设组合,能带来约2.6倍的缓存压缩,而困惑度损失很小;量化器的配置也完全开放,位宽和归一化修正都可以自己调。由于它紧密跟随上游vLLM,你熟悉的连续批处理、PagedAttention、OpenAI兼容API这些标准服务能力都保留着,只是额外多了一层量化。如果你已经在跑vLLM,想在买新卡之前从现有硬件里多榨出一些上下文长度或吞吐量,这个仓库是个很聚焦的试验场。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。