#256 · 主分类: 计算机视觉

Video-LLaMA

blip2 cross-modal-pretraining large-language-models llama minigpt4 multi-modal-chatgpt video-language-pretraining vision-language-pretraining

[EMNLP 2023 演示] Video-LLaMA:面向视频理解的指令调优音视频语言模型

项目最后更新:06/04/24

GitHub Stars

3.1K

Forks数量

287

贡献者数量

7

许可证

BSD-3-Clause

收录理由

大多数多模态模型只能处理单张图片,Video-LLaMA 则把能力扩展到了视频和音频:语言模型既能回答画面里发生了什么,也能理解视频中说话的内容。这个项目做得相当实在,架构、训练数据和具体权重都交代得很清楚,7B 和 13B 版本直接给出完整权重,省去了拼接 delta 权重的麻烦。上手之前可以先在网页上试玩演示,不用急着花本地 GPU 时间。基于 BLIP-2 和 MiniGPT-4 的两阶段训练流程写得很详细,做多模态指令微调的研究者可以参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目