#121 · 主分类: 推理与本地部署

pruna

ai computer-vision deep-learning diffusers diffusion-models hacktoberfest llm machine-learning optimization python speech-recognition transformers

Pruna 是一个面向开发者的模型优化框架,让您以最小的开销交付更快、更高效的模型。

项目最后更新:08/27/26

GitHub Stars

1.3K

Forks数量

103

贡献者数量

37

许可证

Apache-2.0

收录理由

如果你的Transformer、扩散模型或语音模型已经接近上线,却总被延迟、显存占用或GPU账单卡住,Pruna值得一看。它把量化、剪枝、蒸馏、缓存和硬件编译整合在一个smash()调用里,你可以在同一个模型上叠加多种优化手段,而不必把多个独立库拼凑起来。API非常简洁:照常加载预训练模型,传入一个列出所需技术的配置,就能拿到一个优化后但行为与原来一致的版本。它还带有评估接口,能告诉你压缩后的模型实际损失了多少,这一点在放心投入生产之前尤为重要。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目