#164 · 主分类: 计算机视觉
claude-video-vision
claude-code
claude-code-plugin
ffmpeg
gemini
mcp
mcp-server
multimodal
video-analysis
whisper
让Claude具备观看和理解视频的能力——Claude Code插件,支持帧提取和多模态音频分析
项目最后更新:08/07/26
GitHub Stars
1.3K
Forks数量
152
贡献者数量
7
许可证
MIT
收录理由
这个插件让Claude真正看得见、听得懂视频内容。它不自己造轮子做视觉识别,而是老老实实当感知层:用ffmpeg从本地文件或YouTube链接抽帧,音频部分交给Gemini、本地Whisper或OpenAI转成带时间戳的文字,Claude把画面和文字当证据来读。这种分工在实际场景里很管用,比如排查录屏里的bug、总结一小时讲座、或者确认某段视频特定时刻出现了什么文字。安装走市场命令,不用编译;提问方式不同,抽帧的帧率、时间范围、分辨率也会跟着调整;云端和本地后端都能选,想保密的话转录完全可以留在自己机器上。插件把推理留给底层模型,只喂证据不给结论。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。