#164 · 主分类: 深度学习框架

mmdit

artificial-intelligence attention-mechanisms deep-learning multi-modal-attention

在Pytorch中实现Stable Diffusion 3中提出的MMDiT单层。

项目最后更新:01/18/26

GitHub Stars

555

Forks数量

17

贡献者数量

1

许可证

MIT

收录理由

这个仓库把Stable Diffusion 3里提出的MMDiT块单独拎出来,做成一个清晰可读的PyTorch模块。它不附带完整的训练流程,而是给你一个能直接塞进自己扩散代码里的积木,同时还有一个推广版本,把原本只处理文本和图像的双模态思路扩展到更多模态,让文本、图像、音频、视频的token都能在同一个transformer里混合。代码很短,翻一遍就能明白整流流变换器是怎么把条件信号揉在一起的,想改造成自己的生成实验也很方便。另外还附带了一个用学习门控来自适应选择权重的自注意力变体,给对标准做法之外感兴趣的人多一个参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目