#104 · 主分类: 图像生成
LlamaGen
自回归模型胜过扩散:🦙 Llama 用于可扩展图像生成
项目最后更新:08/15/24
GitHub Stars
2.0K
Forks数量
95
贡献者数量
5
许可证
MIT
收录理由
这个研究代码库提出了一个有趣的思路:图像生成可以像语言建模一样,用朴素的Llama结构逐个预测视觉token,而不依赖视觉专属的归纳偏置。LlamaGen提供了验证这一主张所需的全部组件——两个下采样率分别为8和16的图像分词器、七个参数从1亿到30亿的类别条件生成模型、两个7亿参数规模的文本条件模型,还附带了PyTorch的训练与采样代码以及在线Hugging Face演示。已发布的权重允许你直接采样图像,推理也支持vLLM,无需重新训练就能和扩散模型基线做对比。严格来说它是一份研究性质的开源实现,而非开箱即用的生产级服务,但这种定位恰恰构成了它的价值:论文、权重和代码放在一起,让研究者能方便地审视自回归模型在扩展过程中与扩散模型的实际差距。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。