#120 · 主分类: 图像生成

CogView

pretrained-models pytorch text-to-image transformers

文本到图像生成。NeurIPS 2021 论文“CogView: Mastering Text-to-Image Generation via Transformers”的代码仓库。

项目最后更新:09/25/23

GitHub Stars

1.8K

Forks数量

175

贡献者数量

5

许可证

Apache-2.0

收录理由

CogView 是 NeurIPS 2021 论文的官方代码,对应一个 40 亿参数的 Transformer 模型,能够根据文字提示生成图像。仓库里不光有预训练权重,还带上了 VQ-VAE 图像分词器,以及推理、超分、图文重排的脚本,拿到手就能把整条流程跑通,而不是只停留在论文描述上。对于想观察大型自回归 Transformer 在视觉生成上表现的研究团队,训练细节和结果同样关键:论文里提出的 PB-relax 和 Sandwich-LN 两种技巧,专门用来维持深层 Transformer 的稳定性,值得仔细琢磨。需要说明的是,发布模型针对简体中文输入做了调优,所以更适合中文场景下的生成任务,或者用来做架构研究,而不是直接当作英文文生图服务来用。另外,后置的评分重排步骤展示了一套完整的生成工作流,自己搭建类似系统时很有参考价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目