#134 · 主分类: 计算机视觉
InternVideo
action-recognition
benchmark
contrastive-learning
foundation-models
instruction-tuning
masked-autoencoder
multimodal
open-set-recognition
self-supervised
spatio-temporal-action-localization
temporal-action-localization
video-clip
video-data
video-dataset
video-question-answering
video-retrieval
video-understanding
vision-transformer
zero-shot-classification
zero-shot-retrieval
[ECCV2024] 视频基础模型与多模态理解数据
项目最后更新:07/02/26
GitHub Stars
2.4K
Forks数量
159
贡献者数量
29
许可证
Apache-2.0
收录理由
这个仓库汇集了OpenGVLab团队在视频基础模型方向的多代成果和配套工作,目标不是让机器简单回放或检索视频,而是真正理解视频内容。项目覆盖动作识别、时序动作定位、视频文本检索以及开放式视频问答等任务,既提供预训练编码器,也提供对话式模型,方便研究者按需取用。工程师可以直接加载这些权重来构建定制化的视频特征,不必从头训练。仓库还附带InternVid大规模视频文本数据集,对微调和评测都有实用价值。整体偏研究性质,以技术报告和模型权重为主,缺少部署工具链,但能把这么多任务集中在一处,做视频骨干网络对比时是个方便的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。