#112 · 主分类: 推理与本地部署

auto-round

diffusers gguf int4 llms mxfp4 nvfp4 omni quantization rounding sglang transformers vllm vlms

SOTA量化工具包,用于高精度低比特LLM推理,无缝优化CPU/XPU/CUDA,支持多种数据类型,并与vLLM、SGLang和Transformers完全兼容。

项目最后更新:08/29/26

GitHub Stars

1.6K

Forks数量

168

贡献者数量

42

许可证

Apache-2.0

收录理由

很多团队部署大模型时最头疼的一步,就是如何把模型压到2到4比特,同时又不让精度崩掉。AutoRound 用符号梯度下降的思路解决这个难题,相关方法发表在 SignRound 系列论文里,在极低比特下仍能保持较高的质量。项目同时提供 Python API 和命令行工具,你既能快速做实验,也能直接写成脚本批量跑,不用切换工作流。更实用的是,量化后的模型可以导出为 AutoRound、AutoAWQ、AutoGPTQ 或 GGUF 格式,并直接加载到 Transformers、vLLM、SGLang 这些常见框架里,接入现有系统非常顺滑。它还支持免校准和免模型模式,当手头没有合适的参考硬件或数据时,也能完成量化。简单说,它把低比特量化常见的精度损失和格式兼容问题都解决了,让团队不再因为这两道坎而拖延部署计划。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目