#55 · 主分类: 基础模型
Show-o
[ICLR & NeurIPS 2025] Show-o系列仓库:单一Transformer统一多模态理解与生成。
项目最后更新:01/08/26
GitHub Stars
2.0K
Forks数量
94
贡献者数量
9
许可证
Apache-2.0
收录理由
Show-o 来自新加坡国立大学 Show Lab 与字节跳动,把图像和文本的理解、生成任务揉进同一个 Transformer 里。一个模型既能给照片写说明,也能回答视觉问题,还能根据提示词直接画出新图,不用在多个系统之间来回切换。文本部分用自回归方式解码,图像 token 则靠离散扩散生成;后续的 Show-o2 把同一套思路扩展到视频和混合模态,提供了 1.5B 和 7B 两档规模。如果你不想走“视觉编码器加扩散管线”的老路子,而是想试试原生统一多模态模型,这个仓库给出了训练和推理代码、预训练权重,还有一个 Hugging Face 在线演示,动手前可以先体验。它对于理解因果注意力与全注意力如何在不同 token 类型上共存,也是一份不错的参考资料。代码偏研究型,附有配置和消融实验表,不是拿来即用的产品,但正因如此,想深入琢磨架构的话,这里是个合适的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。