#121 · 主分类: 图像生成

muse-maskgit-pytorch

artificial-intelligence attention-mechanisms deep-learning text-to-image transformers

Muse模型的Pytorch实现:使用掩码生成变换器进行文本到图像生成

项目最后更新:02/29/24

GitHub Stars

918

Forks数量

87

贡献者数量

4

许可证

MIT

收录理由

Google 的 Muse 模型利用掩码生成式 Transformer 实现文生图,这个仓库正是该方案在 PyTorch 下的复现,但它的组织方式更像一套可训练的组件,而非拿来即用的完整管线。仓库里包含 VQGan VAE,负责把图像离散化成码本;MaskGit Transformer 则根据文本提示预测被掩码的图像 token;最后 Muse 包装器将低分辨率基础模型与超分阶段串联,可产出 256 或 512 像素的图片。码本大小、Transformer 深度、无分类器引导的尺度等参数都开放可调,你完全可以从训练小尺寸图像起步,之后再扩大到更大分辨率。对于想研究基于 token 的文生图原理,或希望在自己数据集上训练定制生成器(而不是直接消费预训练权重)的人来说,这是一个很实在的起点。端到端的训练与生成代码都在仓库里,省去了自己从论文复现的功夫。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目