#140 · 主分类: 图像生成
text-to-image
使用思维向量进行文本到图像的合成
项目最后更新:01/30/18
GitHub Stars
2.2K
Forks数量
398
贡献者数量
4
许可证
MIT
收录理由
这个仓库把早期文本生成图像的一种代表性方法实现得相当紧凑,代码量不大,读起来很直观。它按照《Generative Adversarial Text-to-Image Synthesis》论文里的GAN-CLS思路,用Skip-Thought向量编码文字描述,再交给DCGAN结构去生成64×64的图片,核心流程清晰,适合想从零理解这个算法的人。项目里包含了数据处理、训练和推理的脚本,还附带数据下载器和在花朵数据集上预训练好的模型,意味着你不必从头跑一遍完整训练,也能直接拿现成权重来生成样本体验效果。不过它本质上是个研究性质的原型,而不是持续维护的工程产品,整个流程依赖Python 2.7和那个年代的TensorFlow环境,今天想直接部署会相当费劲。如果你正在钻研原始论文,或者需要一个简单基准来对照现代的文本生成图像模型,那读这份代码的价值远大于把它投入生产使用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。