#313 · 主分类: 计算机视觉
MovieChat
computer-vision
dataset
large-language-models
llama
long-video-understanding
multimodal-large-language-models
[CVPR 2024] MovieChat:从密集令牌到稀疏记忆的长视频理解
项目最后更新:01/29/25
GitHub Stars
706
Forks数量
44
贡献者数量
5
许可证
BSD-3-Clause
收录理由
MovieChat 是 CVPR 2024 发表的研究系统,直接针对视频理解中的上下文长度瓶颈。它采用多模态大语言模型架构,将密集的视觉令牌压缩为稀疏记忆表示,从而在单张 24GB 显卡上处理超过一万帧的视频。仓库提供了模型代码、训练与评估脚本,以及带公开排行榜的 MovieChat-1K 基准,可作为对比新近长视频方法的参照点。对于构建视频问答或摘要工具的团队,即使计划基于更新的基础模型开发,也能借鉴其记忆压缩思路和评估框架。不过它属于研究原型而非开箱即用的服务,实际落地前需要自行改造代码。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。