#91 · 主分类: 知识库与企业搜索

VideoRAG

large-language-models llms long-video-understanding multi-modal-llms rag retrieval-augmented-generation

[KDD'2026] "VideoRAG: 与你的视频聊天"

项目最后更新:03/18/26

GitHub Stars

3.3K

Forks数量

479

贡献者数量

6

许可证

Other

收录理由

在视频里找内容,至今仍比在文档里找内容别扭得多。VideoRAG 瞄准的正是这个痛点——它是一套检索增强生成框架,把视频的画面和声音都做了索引,大模型能直接调取相关片段,回答问题时依据的是屏幕上的真实内容,而不是靠猜。如果你手里攒着大量录像,比如会议存档、课程录播、原始素材,它会很对路;它处理长视频时能覆盖好几个小时,不会把内容切成记不住的碎片。仓库里除了研究框架,还带了个桌面应用 Vimo,想上手试试的话,不用先搭整套系统,直接打开它就能交互体验。项目还公开了一个标注超过百小时的基准数据集,想评估自己的场景下检索效果如何,有了这把实打实的尺子,心里会更有底。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目