#66 · 主分类: 推理与本地部署

llm-compressor

compression quantization

与Transformers兼容的库,用于对LLM应用各种压缩算法,以优化vLLM部署。

项目最后更新:08/28/26

GitHub Stars

3.7K

Forks数量

644

贡献者数量

198

许可证

Apache-2.0

收录理由

用 vLLM 部署开源模型,瓶颈常常卡在显存上,这个库就是为了解决这个问题而生的。你只需要把一个 Hugging Face 模型交给它,从内置的 GPTQ、AWQ、SmoothQuant、AutoRound 以及更新的基于旋转的量化方法中挑一种,再用自己的一部分数据做校准就行。压缩范围覆盖权重、激活、KV 缓存和注意力层,最终输出的是 compressed-tensors 格式,vLLM 可以直接加载,拿到手就是能部署的检查点,而不是停留在研究阶段的产物。对那些想削减云成本、或者在现有 GPU 上跑更大模型的团队来说,这是从全精度检查点到精简版最直接的路,不用自己手写校准代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目