#201 · 主分类: 视频与动画
Video-ChatGPT
一个开源视频对话模型,通过结合大型语言模型与时空视觉编码,生成关于视频内容的详细、有意义的对话,并具备定量基准测试框架。
项目最后更新:08/05/25
GitHub Stars
1.5K
Forks数量
128
贡献者数量
4
许可证
Other
收录理由
Video-ChatGPT 把预训练好的视觉编码器接到语言模型上,让模型能同时捕捉视频里的空间细节和时间变化,因此它不只是把视频当成一张静态图来理解,而是能真正回答“这段画面里发生了什么”这类问题。对于想做视频问答助手、自动生成字幕、无障碍辅助或需要理解动作和时序的搜索工具来说,这个项目提供了一个很实用的基础。仓库里还附带了 ACL 2024 论文中提出的定量评测基准,以及训练所用的视频指令数据,团队可以用这套标准来衡量其他视频对话模型的表现,而不只是靠几个演示片段来下结论。如果你在尝试多模态理解方向,这个代码库很适合用来让聊天模型学会谈论动态影像。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。