#97 · 主分类: 图像生成
MiniGPT-5
论文《MiniGPT-5:利用生成式Vokens实现交错视觉与语言生成》的官方实现
项目最后更新:05/08/25
GitHub Stars
869
Forks数量
52
贡献者数量
6
许可证
Apache-2.0
收录理由
MiniGPT-5 解决的是一个更复杂的创作场景:让语言模型在生成文字的同时,把配图也一并产出,而不是简单地在聊天机器人后面挂个图像生成器。它通过在文本流中插入可学习的“voken”标记图像位置,再把这些位置信息交给 Stable Diffusion,让图片和周围的叙述紧密挂钩。模型基于 MiniGPT-4 架构,采用 Vicuna 作为主干、BLIP-2 作为视觉编码器,两阶段的训练方案避免了依赖详细的图像描述,同时引入无分类器引导来保证图文协同。对于研究多模态对话、视觉叙事,或是任何希望从单一模型同时获得文字和匹配图片的团队来说,这个项目很有参考价值。不过它属于学术代码库,需要自己准备预训练权重和足够的 GPU 资源,更适合当作一个基础框架来改造,而不是直接拿去部署。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。