#256 · 主分类: 计算机视觉
Video-LLaMA
blip2
cross-modal-pretraining
large-language-models
llama
minigpt4
multi-modal-chatgpt
video-language-pretraining
vision-language-pretraining
[EMNLP 2023 演示] Video-LLaMA:面向视频理解的指令调优音视频语言模型
项目最后更新:06/04/24
GitHub Stars
3.1K
Forks数量
287
贡献者数量
7
许可证
BSD-3-Clause
收录理由
大多数多模态模型只能处理单张图片,Video-LLaMA 则把能力扩展到了视频和音频:语言模型既能回答画面里发生了什么,也能理解视频中说话的内容。这个项目做得相当实在,架构、训练数据和具体权重都交代得很清楚,7B 和 13B 版本直接给出完整权重,省去了拼接 delta 权重的麻烦。上手之前可以先在网页上试玩演示,不用急着花本地 GPU 时间。基于 BLIP-2 和 MiniGPT-4 的两阶段训练流程写得很详细,做多模态指令微调的研究者可以参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。