#214 · 主分类: 计算机视觉
Video-LLaVA
instruction-tuning
large-vision-language-model
multi-modal
【EMNLP 2024🔥】Video-LLaVA:通过投影前对齐学习统一视觉表示
项目最后更新:12/03/24
GitHub Stars
3.5K
Forks数量
255
贡献者数量
6
许可证
Apache-2.0
收录理由
Video-LLaVA 是一个能同时处理静态图片和视频帧的视觉语言模型,输入一段影像后,它会输出自然语言描述,也能回答关于画面内容的问题、对细节做推理判断。它的特别之处在于,在把视觉特征投射进语言模型之前,就先让视觉与语言特征完成对齐,这样一来,同一个编码器就能兼顾图像和视频,不必为两类输入各建一套流程。项目仓库里准备了预训练和指令微调好的权重,也附带了训练、评测与推理的代码,可以直接跑起来看效果,或者拿它当基线继续做自己的实验。如果你正在做视频理解或自动描述方面的原型验证,想找一个开箱即用的开源模型在自己的素材上试试,这个项目值得加载起来实际测一测。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。