#291 · 主分类: 计算机视觉

UniTok

autoregressive-models generative generative-ai generative-model image-generation image-tokenizer large-language-models text-to-image tokenizer

[NeurIPS 2025 Spotlight] 面向视觉生成与理解的统一分词器

项目最后更新:11/14/25

GitHub Stars

530

Forks数量

14

贡献者数量

4

许可证

MIT

收录理由

UniTok 提供一个统一的视觉分词器,让生成模型(如 LlamaGen)和理解模型(如 LLaVA)共用同一套离散 token,省去各自单独训练编码器的麻烦。它出自 NeurIPS 2025 Spotlight 论文,作者还在其基础上搭建了 Liquid 框架,构建出一个既能生成又能理解的多模态模型,并声称在自回归多模态大模型中达到了新的最优水平。一个对实际应用很有价值的发现是:UniTok 不需要 classifier-free guidance 就能稳定生成,搭配 LlamaGen-XXL 在 ImageNet 256×256 上能把 gFID 从 14.6 降到 2.51。项目附有模型权重、Hugging Face 在线试玩和评估配置,想亲手验证的话可以直接上手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目