#106 · 主分类: 计算机视觉
Ask-Anything
[CVPR2024 Highlight][VideoChatGPT] 具有视频理解能力的ChatGPT!并且支持更多语言模型,如miniGPT4、StableLM和MOSS。
项目最后更新:07/17/26
GitHub Stars
3.3K
Forks数量
268
贡献者数量
13
许可证
MIT
收录理由
这个项目把多套视频语言模型收拢在同一套代码里,核心理念很直接:对着视频或图片提问,模型给出对话式回答,而不是只输出一句描述。它脱胎于VideoChat系列,该系列在CVPR 2024上获得Highlight,把视频理解当作对话任务来处理。仓库里既有端到端训练的模型,也有以ChatGPT、StableLM、MOSS或MiniGPT-4作为语言模块的变体。除了预训练权重,还提供了训练与指令微调流程、公开的指令数据集以及演示笔记本,相当于一套完整的参考资料。对想构建视频问答、视频摘要功能,或是打算对比不同开源视频语言模型、针对特定任务做微调的团队来说,能省去不少从头搭建的功夫。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。