#55 · 主分类: 基础模型

Show-o

diffusion-models large-language-models multimodal

[ICLR & NeurIPS 2025] Show-o系列仓库:单一Transformer统一多模态理解与生成。

项目最后更新:01/08/26

GitHub Stars

2.0K

Forks数量

94

贡献者数量

9

许可证

Apache-2.0

收录理由

Show-o 来自新加坡国立大学 Show Lab 与字节跳动,把图像和文本的理解、生成任务揉进同一个 Transformer 里。一个模型既能给照片写说明,也能回答视觉问题,还能根据提示词直接画出新图,不用在多个系统之间来回切换。文本部分用自回归方式解码,图像 token 则靠离散扩散生成;后续的 Show-o2 把同一套思路扩展到视频和混合模态,提供了 1.5B 和 7B 两档规模。如果你不想走“视觉编码器加扩散管线”的老路子,而是想试试原生统一多模态模型,这个仓库给出了训练和推理代码、预训练权重,还有一个 Hugging Face 在线演示,动手前可以先体验。它对于理解因果注意力与全注意力如何在不同 token 类型上共存,也是一份不错的参考资料。代码偏研究型,附有配置和消融实验表,不是拿来即用的产品,但正因如此,想深入琢磨架构的话,这里是个合适的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目