#186 · 主分类: 图像生成
parti-pytorch
Parti(Google的纯注意力机制文本到图像神经网络)的Pytorch实现。
项目最后更新:12/08/23
GitHub Stars
537
Forks数量
25
贡献者数量
2
许可证
MIT
收录理由
Parti 是 Google 针对扩散式文生图模型给出的另一种解法:它不靠去噪像素,而是把图像生成当作离散视觉 token 上的自回归序列问题。这个仓库用 PyTorch 从零实现了该架构,并搭配了一个基于 ViT 的 VQ-GAN VAE,还附带了可运行的训练代码,因此你可以顺着从图像编码到文本条件生成的完整链路一步步走通。API 设计得很直接:先训练 VAE,再把它插进 Parti 模块,最后用一串描述调用 generate() 就能得到 PIL 图像,条件缩放参数也暴露了 classifier-free guidance 的调节能力。需要留意的是,这是研究导向的实现,并非开箱即用的服务,你得自己准备数据集和训练算力。如果你想并排比较自回归与扩散两种路线,或者在大规模投入前先拆解一下架构细节,这个项目会是个合适的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。