#60 · 主分类: 图像生成

DALLE2-pytorch

artificial-intelligence deep-learning text-to-image

DALL-E 2 的 PyTorch 实现,OpenAI 更新的文本到图像合成神经网络。

项目最后更新:05/11/24

GitHub Stars

11.3K

Forks数量

1.1K

贡献者数量

17

许可证

MIT

收录理由

DALL-E 2 的生成过程分为两个阶段:扩散先验网络把 CLIP 文本嵌入转换为图像嵌入,解码器再将该嵌入渲染为像素。这个仓库用 PyTorch 完整实现了整条流水线,作者特意选择了效果最好的扩散先验变体进行搭建,因此你拿到的是可直接运行的代码,而不只是论文里的公式。项目真正做到了端到端可训练,外部研究团队已经用它训练出可用的扩散先验,用于 CLIP 和 StyleGAN 的文本生成图像流程;还有人借助仓库自带的脚本,把训练扩展到 800 张 GPU 上。README 也坦承,后来的文本生成图像模型已经超越了它,但如果你想研究这种两阶段设计,或者想自己重训一个变体,这里是一个扎实的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目