#122 · 主分类: MLOps与评测

AngelSlim

audio deepseek dflash diffusion eagle fp4 hunyuan llm llm-compression quantization qwen speculative-decoding vlm

模型压缩工具包,致力于提升易用性、全面性和效率。

项目最后更新:08/07/26

GitHub Stars

1.6K

Forks数量

174

贡献者数量

38

许可证

Other

收录理由

如果你的团队需要把大模型塞进有限的GPU显存再上线服务,AngelSlim值得一试。它把量化、推测解码和蒸馏整合进同一套工具链,省去了在多个独立项目之间来回拼接的麻烦,并且覆盖Qwen、DeepSeek、混元、GLM等当前主流模型家族。选定模型后,你可以直接采用FP8或INT4这类量化方案,拿到可运行的权重和配套脚本,能顺利接入vLLM或llama.cpp等推理服务栈。工具在低位压缩上做得比较深入,最低支持到1.25比特,同时包含让压缩后模型保持响应速度的解码加速技巧——当你试图把前沿规模的checkpoint塞进有限显存时,这一点很关键。另外,它也是个方便对比不同压缩方案优劣的地方,能帮你在正式投入生产前做出更踏实的决定。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目