#25 · 主分类: 图像生成
VAR
用于可扩展图像生成的视觉自回归建模,性能优于扩散模型(NeurIPS 2024最佳论文)。
项目最后更新:11/10/25
GitHub Stars
8.7K
Forks数量
572
贡献者数量
4
许可证
MIT
收录理由
这个仓库是Visual Autoregressive Modeling的官方实现,该项工作拿下了NeurIPS 2024的最佳论文奖。它的思路不是逐像素生成图像,而是逐级预测越来越细的尺度,让GPT风格的Transformer在ImageNet上生成256x256的图像,且计算成本低于同级别的扩散模型。仓库里提供了最高23亿参数的预训练权重,以及训练、采样和评估脚本,既可以快速加载模型跑起来,也可以自己复现实验。对研究自回归图像生成的学者和工程师来说,这是个很有分量的参考;README里还附了一个在线文生图演示,能立刻上手感受效果。如果团队指望的是完整的文生图服务,那这个项目的范围可能偏窄,但要是想了解“下一尺度预测”这条有别于扩散模型的路径,这份代码库清晰易读,背后又有顶会论文支撑,值得仔细看看。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。