#70 · 主分类: 基础模型
mPLUG-Owl
alpaca
chatbot
chatgpt
damo
dialogue
gpt
gpt4
gpt4-api
huggingface
instruction-tuning
large-language-models
llama
mplug
mplug-owl
multimodal
pretraining
pytorch
transformer
video
visual-recognition
mPLUG-Owl:强大的多模态大语言模型家族
项目最后更新:04/02/25
GitHub Stars
2.5K
Forks数量
189
贡献者数量
11
许可证
MIT
收录理由
mPLUG-Owl 是一族多模态大语言模型,历经三代迭代:初版奠定基础,第二版被 CVPR 2024 列为 Highlight,第三版则专攻长图像序列的理解。这种梯度式的版本布局让你能按需选择:简单的视觉问答可以用轻量版,涉及多图或视频的任务则可以交给更新的模型。仓库里既有推理脚本也有训练代码,预训练权重放在 Hugging Face 上,还额外提供了面向中文优化的 mPLUG-Owl2.1 变体,对中文场景更友好。它的视觉模块与语言主干解耦,这种设计对想在自己数据上做微调的研究者很有参考价值,也是工程人员搭建多模态对话系统时一个靠谱的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。