#64 · 主分类: 图像生成
Infinity
[CVPR 2025 Oral]Infinity ∞ :扩展比特级自回归建模以进行高分辨率图像合成
项目最后更新:04/16/26
GitHub Stars
1.6K
Forks数量
93
贡献者数量
6
许可证
MIT
收录理由
Infinity 是 CVPR 2025 Oral 项目,把自回归图像生成推进到了比特层面。它的分词器不再依赖有限词表预测下一个 token,而是直接预测比特,作者认为这种方式在高分辨率合成上扩展性更好。仓库提供了 2B 和 8B 的权重,能从文本提示生成 1024×1024 的照片级图像,报告中的 GenEval 和 ImageReward 分数超过 SD3-Medium,未经额外优化时生成一张图大约只需 0.8 秒。训练与推理代码、在线演示以及 Hugging Face 权重一应俱全,既可以拿来直接跑,也能深入研读方法细节。如果你正在对比 VAR 这类自回归方案与扩散管线的优劣,这里是一个很有价值的参考点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。