#130 · 主分类: 图像生成

deep-daze

artificial-intelligence deep-learning implicit-neural-representation multi-modality siren text-to-image transformers

使用OpenAI的CLIP和Siren(隐式神经表示网络)进行文本到图像生成的简单命令行工具。该技术最初由 https://twitter.com/advadnoun 创建。

项目最后更新:03/13/22

GitHub Stars

4.3K

Forks数量

309

贡献者数量

14

许可证

MIT

收录理由

Deep Daze 是 CLIP 引导文生图技术最早的实际演示之一,这项技术由 Ryan Murdock 发现,Lucidrains 把它做成了一个命令行工具。你输入一句话,比如“想象森林里的一栋房子”,它会利用 OpenAI 的 CLIP 来引导 SIREN 网络,不断调整渲染结果,直到生成的图像与你的描述匹配。对于想亲手体验提示词驱动合成原理的人来说,这是个很直观的入门方式,项目还提供了 Colab 笔记本和 --deeper 参数来提升输出质量。运行它需要一块 Nvidia 或 AMD 显卡,显存至少 4GB。跟现在的生成模型相比,它确实显得有些过时,但作为了解这个领域基础的教具,依然有它的价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目