#108 · 主分类: 推理与本地部署
GPTQModel
LLM模型量化(压缩)工具包,通过HF、vLLM和SGLang支持Nvidia、AMD、Intel GPU及Intel/AMD/Apple CPU的硬件加速。
项目最后更新:08/28/26
GitHub Stars
1.2K
Forks数量
204
贡献者数量
94
许可证
Other
收录理由
在单张消费级显卡上运行大模型,量化往往是绕不开的一步,GPTQModel 正是把这件事做得相当完整的工具集。它实现了 GPTQ 与 AWQ 两种主流量化方案,能把模型压缩到仅需原来几分之一的显存,同时保持足以支撑实际推理的速度。硬件适配的广度很少见:CUDA、ROCm、Intel XPU、华为昇腾 NPU,以及 Intel、AMD 和 Apple 的 CPU 都有对应的内核;量化后的权重既可以通过 Hugging Face 加载,也能接入 vLLM 或 SGLang,这意味着同一个模型既能先在笔记本上跑通验证,也能无缝迁移到生产环境的推理服务。项目对新技术跟进很积极,近期已经加入 Blackwell GPU 内核,并持续适配一批新出现的模型架构——要知道,量化代码往往滞后于新模型发布,这种快速迭代对实际使用者来说相当有价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。