#112 · 主分类: 推理与本地部署
auto-round
SOTA量化工具包,用于高精度低比特LLM推理,无缝优化CPU/XPU/CUDA,支持多种数据类型,并与vLLM、SGLang和Transformers完全兼容。
项目最后更新:08/29/26
GitHub Stars
1.6K
Forks数量
168
贡献者数量
42
许可证
Apache-2.0
收录理由
很多团队部署大模型时最头疼的一步,就是如何把模型压到2到4比特,同时又不让精度崩掉。AutoRound 用符号梯度下降的思路解决这个难题,相关方法发表在 SignRound 系列论文里,在极低比特下仍能保持较高的质量。项目同时提供 Python API 和命令行工具,你既能快速做实验,也能直接写成脚本批量跑,不用切换工作流。更实用的是,量化后的模型可以导出为 AutoRound、AutoAWQ、AutoGPTQ 或 GGUF 格式,并直接加载到 Transformers、vLLM、SGLang 这些常见框架里,接入现有系统非常顺滑。它还支持免校准和免模型模式,当手头没有合适的参考硬件或数据时,也能完成量化。简单说,它把低比特量化常见的精度损失和格式兼容问题都解决了,让团队不再因为这两道坎而拖延部署计划。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。