#184 · 主分类: AI对话与Chatbot
Multimodal-GPT
Multimodal-GPT
项目最后更新:06/04/23
GitHub Stars
1.5K
Forks数量
128
贡献者数量
11
许可证
Apache-2.0
收录理由
这是一个较早的多模态对话模型项目,展示了如何基于OpenFlamingo搭建视觉语言聊天机器人。OpenMMLab团队从VQA、图像描述、视觉推理、OCR和对话等公开数据集中构造了视觉指令数据,并用这些数据训练模型,同时加入纯语言指令来训练语言部分。项目报告指出这种联合训练能明显改善模型表现,因此仓库很适合作为参考模板,如果你想用开源权重构建自己的助手。项目还附带技术报告和训练代码,对刚接触这类模型改造的开发者比较友好。不过项目自2023年年中起更新停滞,建议把它当作学习材料而非依赖库来用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
open-webui
易用的AI界面(支持Ollama、OpenAI API等)
NextChat
✨ 轻快的人工智能助手。支持:Web | iOS | MacOS | Android | Linux | Windows
gpt4free
官方gpt4free仓库 | 各种强大语言模型的集合 | opus 4.6 gpt 5.3 kimi 2.5 deepseek v3.2 gemini 3
system_prompts_leaks
从Anthropic - Claude Fable 5、Opus 5、Claude Design、Claude Code,OpenAI - ChatGPT GPT-5.6-Sol、Codex,Google - Gemini 3.5 Flash、3.1 Pro、Antigravity,xAI - Grok、Cursor、Copilot、VS Code、Perplexity 等提取的系统提示词。定期更新。
cherry-studio
AI生产力工作室,具备智能聊天、自主代理和300+助手,统一访问前沿大语言模型。