#104 · 主分类: 图像生成

LlamaGen

auto-regressive-model diffusion diffusion-models image-generation llama llm text2image

自回归模型胜过扩散:🦙 Llama 用于可扩展图像生成

项目最后更新:08/15/24

GitHub Stars

2.0K

Forks数量

95

贡献者数量

5

许可证

MIT

收录理由

这个研究代码库提出了一个有趣的思路:图像生成可以像语言建模一样,用朴素的Llama结构逐个预测视觉token,而不依赖视觉专属的归纳偏置。LlamaGen提供了验证这一主张所需的全部组件——两个下采样率分别为8和16的图像分词器、七个参数从1亿到30亿的类别条件生成模型、两个7亿参数规模的文本条件模型,还附带了PyTorch的训练与采样代码以及在线Hugging Face演示。已发布的权重允许你直接采样图像,推理也支持vLLM,无需重新训练就能和扩散模型基线做对比。严格来说它是一份研究性质的开源实现,而非开箱即用的生产级服务,但这种定位恰恰构成了它的价值:论文、权重和代码放在一起,让研究者能方便地审视自回归模型在扩展过程中与扩散模型的实际差距。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目