#187 · 主分类: 推理与本地部署

distrifuser

acceleration diffusion-models generative-ai generative-model parallelism

[CVPR 2024 Highlight] DistriFusion:高分辨率扩散模型的分布式并行推理

项目最后更新:12/02/24

GitHub Stars

728

Forks数量

34

贡献者数量

1

许可证

MIT

收录理由

高分辨率扩散模型在单张GPU上推理速度慢,重新训练模型又代价高昂,DistriFusion直接针对这一痛点给出了轻量解法。它把图像按块拆分到多张GPU上并行处理,并复用前一步去噪的激活值来掩盖通信开销,从而在不明显损失画质的前提下获得接近线性的加速,分辨率越高收益越明显。代码接口与Hugging Face的diffusers保持一致,只需换成DistriSDXLPipeline、配置好DistriConfig,再用torchrun启动即可,无需重写生成流程。该项目入选CVPR 2024 highlight,NVIDIA将其整合进TensorRT-LLM,ColossalAI也提供了支持,说明这套方法在参考实现之外同样经得起检验。如果你已经在用多卡PyTorch环境,这可能是改动最小、见效最快的扩散推理加速方式。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目