#97 · 主分类: 图像生成

MiniGPT-5

diffusion-models multimodal-generation multimodal-llm transformers

论文《MiniGPT-5:利用生成式Vokens实现交错视觉与语言生成》的官方实现

项目最后更新:05/08/25

GitHub Stars

869

Forks数量

52

贡献者数量

6

许可证

Apache-2.0

收录理由

MiniGPT-5 解决的是一个更复杂的创作场景:让语言模型在生成文字的同时,把配图也一并产出,而不是简单地在聊天机器人后面挂个图像生成器。它通过在文本流中插入可学习的“voken”标记图像位置,再把这些位置信息交给 Stable Diffusion,让图片和周围的叙述紧密挂钩。模型基于 MiniGPT-4 架构,采用 Vicuna 作为主干、BLIP-2 作为视觉编码器,两阶段的训练方案避免了依赖详细的图像描述,同时引入无分类器引导来保证图文协同。对于研究多模态对话、视觉叙事,或是任何希望从单一模型同时获得文字和匹配图片的团队来说,这个项目很有参考价值。不过它属于学术代码库,需要自己准备预训练权重和足够的 GPU 资源,更适合当作一个基础框架来改造,而不是直接拿去部署。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目