#187 · 主分类: 推理与本地部署
distrifuser
[CVPR 2024 Highlight] DistriFusion:高分辨率扩散模型的分布式并行推理
项目最后更新:12/02/24
GitHub Stars
728
Forks数量
34
贡献者数量
1
许可证
MIT
收录理由
高分辨率扩散模型在单张GPU上推理速度慢,重新训练模型又代价高昂,DistriFusion直接针对这一痛点给出了轻量解法。它把图像按块拆分到多张GPU上并行处理,并复用前一步去噪的激活值来掩盖通信开销,从而在不明显损失画质的前提下获得接近线性的加速,分辨率越高收益越明显。代码接口与Hugging Face的diffusers保持一致,只需换成DistriSDXLPipeline、配置好DistriConfig,再用torchrun启动即可,无需重写生成流程。该项目入选CVPR 2024 highlight,NVIDIA将其整合进TensorRT-LLM,ColossalAI也提供了支持,说明这套方法在参考实现之外同样经得起检验。如果你已经在用多卡PyTorch环境,这可能是改动最小、见效最快的扩散推理加速方式。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。