#291 · 主分类: 计算机视觉
UniTok
[NeurIPS 2025 Spotlight] 面向视觉生成与理解的统一分词器
项目最后更新:11/14/25
GitHub Stars
530
Forks数量
14
贡献者数量
4
许可证
MIT
收录理由
UniTok 提供一个统一的视觉分词器,让生成模型(如 LlamaGen)和理解模型(如 LLaVA)共用同一套离散 token,省去各自单独训练编码器的麻烦。它出自 NeurIPS 2025 Spotlight 论文,作者还在其基础上搭建了 Liquid 框架,构建出一个既能生成又能理解的多模态模型,并声称在自回归多模态大模型中达到了新的最优水平。一个对实际应用很有价值的发现是:UniTok 不需要 classifier-free guidance 就能稳定生成,搭配 LlamaGen-XXL 在 ImageNet 256×256 上能把 gFID 从 14.6 降到 2.51。项目附有模型权重、Hugging Face 在线试玩和评估配置,想亲手验证的话可以直接上手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。