#98 · 主分类: 图像生成
DALLE-pytorch
DALL-E(OpenAI的文本到图像Transformer)在Pytorch中的实现/复现。
项目最后更新:02/17/24
GitHub Stars
5.6K
Forks数量
641
贡献者数量
24
许可证
MIT
收录理由
这个项目用 PyTorch 重新实现了 OpenAI 最初的 DALL-E 文生图 Transformer,训练和生成代码都写得很清楚,容易跟着读。研究者和工程师可以替换成 DiscreteVAE 或预训练的 VQGAN 编码器,在自己的图文数据集上训练一个小规模的模型。因为 VAE、自回归 Transformer 和 CLIP 风格的重排序步骤是分开的组件,代码本身也像一份实用的教程,把离散图像 token 和 Transformer 生成怎么结合起来讲得明明白白。要是你想了解 DALL-E 2 之前的管线,或者想在不算太贵的硬件上复现 2021 年的做法,这个库比单纯读论文好上手得多。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。