#313 · 主分类: 计算机视觉

MovieChat

computer-vision dataset large-language-models llama long-video-understanding multimodal-large-language-models

[CVPR 2024] MovieChat:从密集令牌到稀疏记忆的长视频理解

项目最后更新:01/29/25

GitHub Stars

706

Forks数量

44

贡献者数量

5

许可证

BSD-3-Clause

收录理由

MovieChat 是 CVPR 2024 发表的研究系统,直接针对视频理解中的上下文长度瓶颈。它采用多模态大语言模型架构,将密集的视觉令牌压缩为稀疏记忆表示,从而在单张 24GB 显卡上处理超过一万帧的视频。仓库提供了模型代码、训练与评估脚本,以及带公开排行榜的 MovieChat-1K 基准,可作为对比新近长视频方法的参照点。对于构建视频问答或摘要工具的团队,即使计划基于更新的基础模型开发,也能借鉴其记忆压缩思路和评估框架。不过它属于研究原型而非开箱即用的服务,实际落地前需要自行改造代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目