#121 · 主分类: 推理与本地部署
pruna
ai
computer-vision
deep-learning
diffusers
diffusion-models
hacktoberfest
llm
machine-learning
optimization
python
speech-recognition
transformers
Pruna 是一个面向开发者的模型优化框架,让您以最小的开销交付更快、更高效的模型。
项目最后更新:08/27/26
GitHub Stars
1.3K
Forks数量
103
贡献者数量
37
许可证
Apache-2.0
收录理由
如果你的Transformer、扩散模型或语音模型已经接近上线,却总被延迟、显存占用或GPU账单卡住,Pruna值得一看。它把量化、剪枝、蒸馏、缓存和硬件编译整合在一个smash()调用里,你可以在同一个模型上叠加多种优化手段,而不必把多个独立库拼凑起来。API非常简洁:照常加载预训练模型,传入一个列出所需技术的配置,就能拿到一个优化后但行为与原来一致的版本。它还带有评估接口,能告诉你压缩后的模型实际损失了多少,这一点在放心投入生产之前尤为重要。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。