#121 · 主分类: 图像生成
muse-maskgit-pytorch
Muse模型的Pytorch实现:使用掩码生成变换器进行文本到图像生成
项目最后更新:02/29/24
GitHub Stars
918
Forks数量
87
贡献者数量
4
许可证
MIT
收录理由
Google 的 Muse 模型利用掩码生成式 Transformer 实现文生图,这个仓库正是该方案在 PyTorch 下的复现,但它的组织方式更像一套可训练的组件,而非拿来即用的完整管线。仓库里包含 VQGan VAE,负责把图像离散化成码本;MaskGit Transformer 则根据文本提示预测被掩码的图像 token;最后 Muse 包装器将低分辨率基础模型与超分阶段串联,可产出 256 或 512 像素的图片。码本大小、Transformer 深度、无分类器引导的尺度等参数都开放可调,你完全可以从训练小尺寸图像起步,之后再扩大到更大分辨率。对于想研究基于 token 的文生图原理,或希望在自己数据集上训练定制生成器(而不是直接消费预训练权重)的人来说,这是一个很实在的起点。端到端的训练与生成代码都在仓库里,省去了自己从论文复现的功夫。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。