#75 · 主分类: 基础模型

Lumina-T2X

aigc diffusion diffusion-model diffusion-models diffusion-transformer generation-models transformer transformers

Lumina-T2X 是一个用于文本到任意模态生成的统一框架。

项目最后更新:02/16/25

GitHub Stars

2.2K

Forks数量

98

贡献者数量

15

许可证

MIT

收录理由

Lumina-T2X 用一个统一的代码库把文生图、文生视频、文生音频和 3D 生成串在了一起,底层都是同一套基于流的扩散 Transformer 架构,训练和推理的流程也共用。项目里直接给出了 Lumina-Next 图像模型的可用管线,包括 2K 分辨率版本,以及根据多个区域描述进行组合生成的能力;音乐和音频模块也一并带上,权重在 Hugging Face 和 WiseModel 上都能找到。实际使用的场景也覆盖到了,比如图生图转换、Dreambooth 风格微调、对 SD3 的支持,而且图像管线能接进 Hugging Face 的 diffusers 生态,也有 ComfyUI 的封装。仓库里还整理了 Flag-DiT 和 Next-DiT 的训练对比材料,想研究扩散 Transformer 设计的开发者可以拿来直接参考。如果不想调 API,而是想亲手跑通一个前沿的流匹配 Transformer 做复现,这里的代码是具体且能运行的。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目