#201 · 主分类: 视频与动画

Video-ChatGPT

chatbot clip gpt-4 llama llava mulit-modal vicuna video-chatboat video-conversation vision-language vision-language-pretraining

一个开源视频对话模型,通过结合大型语言模型与时空视觉编码,生成关于视频内容的详细、有意义的对话,并具备定量基准测试框架。

项目最后更新:08/05/25

GitHub Stars

1.5K

Forks数量

128

贡献者数量

4

许可证

Other

收录理由

Video-ChatGPT 把预训练好的视觉编码器接到语言模型上,让模型能同时捕捉视频里的空间细节和时间变化,因此它不只是把视频当成一张静态图来理解,而是能真正回答“这段画面里发生了什么”这类问题。对于想做视频问答助手、自动生成字幕、无障碍辅助或需要理解动作和时序的搜索工具来说,这个项目提供了一个很实用的基础。仓库里还附带了 ACL 2024 论文中提出的定量评测基准,以及训练所用的视频指令数据,团队可以用这套标准来衡量其他视频对话模型的表现,而不只是靠几个演示片段来下结论。如果你在尝试多模态理解方向,这个代码库很适合用来让聊天模型学会谈论动态影像。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目