#120 · 主分类: 图像生成
CogView
文本到图像生成。NeurIPS 2021 论文“CogView: Mastering Text-to-Image Generation via Transformers”的代码仓库。
项目最后更新:09/25/23
GitHub Stars
1.8K
Forks数量
175
贡献者数量
5
许可证
Apache-2.0
收录理由
CogView 是 NeurIPS 2021 论文的官方代码,对应一个 40 亿参数的 Transformer 模型,能够根据文字提示生成图像。仓库里不光有预训练权重,还带上了 VQ-VAE 图像分词器,以及推理、超分、图文重排的脚本,拿到手就能把整条流程跑通,而不是只停留在论文描述上。对于想观察大型自回归 Transformer 在视觉生成上表现的研究团队,训练细节和结果同样关键:论文里提出的 PB-relax 和 Sandwich-LN 两种技巧,专门用来维持深层 Transformer 的稳定性,值得仔细琢磨。需要说明的是,发布模型针对简体中文输入做了调优,所以更适合中文场景下的生成任务,或者用来做架构研究,而不是直接当作英文文生图服务来用。另外,后置的评分重排步骤展示了一套完整的生成工作流,自己搭建类似系统时很有参考价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。