#106 · 主分类: 计算机视觉

Ask-Anything

big-model captioning-videos chat chatgpt foundation-models gradio langchain large-language-models large-model stablelm video video-question-answering video-understanding

[CVPR2024 Highlight][VideoChatGPT] 具有视频理解能力的ChatGPT!并且支持更多语言模型,如miniGPT4、StableLM和MOSS。

项目最后更新:07/17/26

GitHub Stars

3.3K

Forks数量

268

贡献者数量

13

许可证

MIT

收录理由

这个项目把多套视频语言模型收拢在同一套代码里,核心理念很直接:对着视频或图片提问,模型给出对话式回答,而不是只输出一句描述。它脱胎于VideoChat系列,该系列在CVPR 2024上获得Highlight,把视频理解当作对话任务来处理。仓库里既有端到端训练的模型,也有以ChatGPT、StableLM、MOSS或MiniGPT-4作为语言模块的变体。除了预训练权重,还提供了训练与指令微调流程、公开的指令数据集以及演示笔记本,相当于一套完整的参考资料。对想构建视频问答、视频摘要功能,或是打算对比不同开源视频语言模型、针对特定任务做微调的团队来说,能省去不少从头搭建的功夫。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目