#184 · 主分类: AI对话与Chatbot

Multimodal-GPT

flamingo gpt gpt-4 llama multimodal transformer vision-and-language

Multimodal-GPT

项目最后更新:06/04/23

GitHub Stars

1.5K

Forks数量

128

贡献者数量

11

许可证

Apache-2.0

收录理由

这是一个较早的多模态对话模型项目,展示了如何基于OpenFlamingo搭建视觉语言聊天机器人。OpenMMLab团队从VQA、图像描述、视觉推理、OCR和对话等公开数据集中构造了视觉指令数据,并用这些数据训练模型,同时加入纯语言指令来训练语言部分。项目报告指出这种联合训练能明显改善模型表现,因此仓库很适合作为参考模板,如果你想用开源权重构建自己的助手。项目还附带技术报告和训练代码,对刚接触这类模型改造的开发者比较友好。不过项目自2023年年中起更新停滞,建议把它当作学习材料而非依赖库来用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目