#39 · 主分类: 基础模型
transfusion-pytorch
artificial-intelligence
attention
deep-learning
flow-matching
multi-modal
transformers
Transfusion的Pytorch实现,'用一个多模态模型预测下一个词元并扩散图像',来自MetaAI
项目最后更新:08/27/26
GitHub Stars
1.4K
Forks数量
75
贡献者数量
2
许可证
MIT
收录理由
MetaAI 的 Transfusion 论文提出用单个模型同时处理文本与图像这类连续数据,本仓库正是该思路的紧凑 PyTorch 实现。代码将论文中的扩散目标换成了 flow matching——也就是 Flux 背后的方法,同时保持接口简洁:你只需把整数张量当作文本、浮点张量当作模态,交错传入,它就能算出用于训练的联合损失,并给出联合生成的采样方法。它还支持多种连续模态,可以为每种模态分别设置潜在维度,也允许接入自定义的编码器与解码器。由于这是一个面向训练的代码库,而非预训练模型,更适合用来研究架构细节,并针对自己的实验做改造。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。