#66 · 主分类: 推理与本地部署
llm-compressor
与Transformers兼容的库,用于对LLM应用各种压缩算法,以优化vLLM部署。
项目最后更新:08/28/26
GitHub Stars
3.7K
Forks数量
644
贡献者数量
198
许可证
Apache-2.0
收录理由
用 vLLM 部署开源模型,瓶颈常常卡在显存上,这个库就是为了解决这个问题而生的。你只需要把一个 Hugging Face 模型交给它,从内置的 GPTQ、AWQ、SmoothQuant、AutoRound 以及更新的基于旋转的量化方法中挑一种,再用自己的一部分数据做校准就行。压缩范围覆盖权重、激活、KV 缓存和注意力层,最终输出的是 compressed-tensors 格式,vLLM 可以直接加载,拿到手就是能部署的检查点,而不是停留在研究阶段的产物。对那些想削减云成本、或者在现有 GPU 上跑更大模型的团队来说,这是从全精度检查点到精简版最直接的路,不用自己手写校准代码。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。