#164 · 主分类: 计算机视觉

claude-video-vision

claude-code claude-code-plugin ffmpeg gemini mcp mcp-server multimodal video-analysis whisper

让Claude具备观看和理解视频的能力——Claude Code插件,支持帧提取和多模态音频分析

项目最后更新:08/07/26

GitHub Stars

1.3K

Forks数量

152

贡献者数量

7

许可证

MIT

收录理由

这个插件让Claude真正看得见、听得懂视频内容。它不自己造轮子做视觉识别,而是老老实实当感知层:用ffmpeg从本地文件或YouTube链接抽帧,音频部分交给Gemini、本地Whisper或OpenAI转成带时间戳的文字,Claude把画面和文字当证据来读。这种分工在实际场景里很管用,比如排查录屏里的bug、总结一小时讲座、或者确认某段视频特定时刻出现了什么文字。安装走市场命令,不用编译;提问方式不同,抽帧的帧率、时间范围、分辨率也会跟着调整;云端和本地后端都能选,想保密的话转录完全可以留在自己机器上。插件把推理留给底层模型,只喂证据不给结论。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目