#131 · 主分类: 计算机视觉

video-search-and-summarization

computer-vision generative-ai long-video-understanding model-context-protocol multimodal-ai natural-language-search nvidia-nim rag real-time-video-analytics retrieval-augmented-generation skills video-agent video-analytics video-rag video-search video-summarization video-understanding vision-agent vision-language-model vlm

GPU加速的参考架构,用于构建视频AI代理,具有实时验证的警报、视觉问答和自动摘要功能。

项目最后更新:08/29/26

GitHub Stars

1.8K

Forks数量

381

贡献者数量

73

许可证

Other

收录理由

这套参考架构把数小时的视频变成可以用自然语言检索和引用的内容,无论是录像还是实时画面,都能用日常语言去提问和探索。NVIDIA 将其打包为 GPU 加速的蓝图,把视觉语言模型、视频嵌入的检索增强生成、大语言模型推理串联成一个智能体,支持视觉问答、长视频摘要、片段检索和经过验证的实时告警。与其说它是一个单一应用,不如说是一份可复用的模板,演示了如何从帧和字幕提取开始,经过消息代理发布,再到通过模型上下文协议暴露工作流,将加速微服务一步步组装起来。对于已经部署 NVIDIA 硬件或 NIM 微服务的团队,这提供了一个能直接运行的起点,省去了自己拼接各个组件的麻烦。如果你正在构建基于智能体的视频理解系统,这份具体实现值得拿来参考和改造。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目