#39 · 主分类: 基础模型

transfusion-pytorch

artificial-intelligence attention deep-learning flow-matching multi-modal transformers

Transfusion的Pytorch实现,'用一个多模态模型预测下一个词元并扩散图像',来自MetaAI

项目最后更新:08/27/26

GitHub Stars

1.4K

Forks数量

75

贡献者数量

2

许可证

MIT

收录理由

MetaAI 的 Transfusion 论文提出用单个模型同时处理文本与图像这类连续数据,本仓库正是该思路的紧凑 PyTorch 实现。代码将论文中的扩散目标换成了 flow matching——也就是 Flux 背后的方法,同时保持接口简洁:你只需把整数张量当作文本、浮点张量当作模态,交错传入,它就能算出用于训练的联合损失,并给出联合生成的采样方法。它还支持多种连续模态,可以为每种模态分别设置潜在维度,也允许接入自定义的编码器与解码器。由于这是一个面向训练的代码库,而非预训练模型,更适合用来研究架构细节,并针对自己的实验做改造。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目