#67 · 主分类: 图像生成
imagen-pytorch
使用Pytorch实现Imagen(谷歌的文本到图像神经网络)
项目最后更新:10/07/24
GitHub Stars
8.4K
Forks数量
795
贡献者数量
20
许可证
MIT
收录理由
这个仓库用 PyTorch 忠实地实现了谷歌的 Imagen——那个在发布时性能超越 DALL-E 2 的级联扩散文生图模型。它把预训练的 T5 编码器、节省内存的 U-Net 以及用于无分类器引导的动态裁剪串在一起,代码模块化程度高,读代码就能理清各组件如何衔接,不必逐行对照原论文。对于想自己训练或改造扩散模型的研究者和工程师来说,这是一份很扎实的学习和实验底子。它算不上开箱即用的成品服务,训练环境得自己搭,但作为可在此基础上二次开发的参考实现,几乎难有更好的选择了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。