#164 · 主分类: 深度学习框架
mmdit
artificial-intelligence
attention-mechanisms
deep-learning
multi-modal-attention
在Pytorch中实现Stable Diffusion 3中提出的MMDiT单层。
项目最后更新:01/18/26
GitHub Stars
555
Forks数量
17
贡献者数量
1
许可证
MIT
收录理由
这个仓库把Stable Diffusion 3里提出的MMDiT块单独拎出来,做成一个清晰可读的PyTorch模块。它不附带完整的训练流程,而是给你一个能直接塞进自己扩散代码里的积木,同时还有一个推广版本,把原本只处理文本和图像的双模态思路扩展到更多模态,让文本、图像、音频、视频的token都能在同一个transformer里混合。代码很短,翻一遍就能明白整流流变换器是怎么把条件信号揉在一起的,想改造成自己的生成实验也很方便。另外还附带了一个用学习门控来自适应选择权重的自注意力变体,给对标准做法之外感兴趣的人多一个参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。