#60 · 主分类: 图像生成
DALLE2-pytorch
DALL-E 2 的 PyTorch 实现,OpenAI 更新的文本到图像合成神经网络。
项目最后更新:05/11/24
GitHub Stars
11.3K
Forks数量
1.1K
贡献者数量
17
许可证
MIT
收录理由
DALL-E 2 的生成过程分为两个阶段:扩散先验网络把 CLIP 文本嵌入转换为图像嵌入,解码器再将该嵌入渲染为像素。这个仓库用 PyTorch 完整实现了整条流水线,作者特意选择了效果最好的扩散先验变体进行搭建,因此你拿到的是可直接运行的代码,而不只是论文里的公式。项目真正做到了端到端可训练,外部研究团队已经用它训练出可用的扩散先验,用于 CLIP 和 StyleGAN 的文本生成图像流程;还有人借助仓库自带的脚本,把训练扩展到 800 张 GPU 上。README 也坦承,后来的文本生成图像模型已经超越了它,但如果你想研究这种两阶段设计,或者想自己重训一个变体,这里是一个扎实的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。