#64 · 主分类: 图像生成

Infinity

auto-regressive-model autoregressive-models generative-model gpt gpt-2 image-generation text-to-image text-to-image-generation transformers

[CVPR 2025 Oral]Infinity ∞ :扩展比特级自回归建模以进行高分辨率图像合成

项目最后更新:04/16/26

GitHub Stars

1.6K

Forks数量

93

贡献者数量

6

许可证

MIT

收录理由

Infinity 是 CVPR 2025 Oral 项目,把自回归图像生成推进到了比特层面。它的分词器不再依赖有限词表预测下一个 token,而是直接预测比特,作者认为这种方式在高分辨率合成上扩展性更好。仓库提供了 2B 和 8B 的权重,能从文本提示生成 1024×1024 的照片级图像,报告中的 GenEval 和 ImageReward 分数超过 SD3-Medium,未经额外优化时生成一张图大约只需 0.8 秒。训练与推理代码、在线演示以及 Hugging Face 权重一应俱全,既可以拿来直接跑,也能深入研读方法细节。如果你正在对比 VAR 这类自回归方案与扩散管线的优劣,这里是一个很有价值的参考点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目