#132 · 主分类: 计算机视觉

claude-real-video

claude claude-code cli ffmpeg keyframe-extraction llm multimodal python scene-detection transcription video-analysis whisper

让Claude(或任何LLM)真正观看视频——从URL或本地文件获取场景感知、去重的帧+转录。本地运行,MIT许可。

项目最后更新:08/28/26

GitHub Stars

2.1K

Forks数量

184

贡献者数量

9

许可证

MIT

收录理由

当你在聊天框里丢进一个视频链接,大模型却只靠字幕文件回答你时,这个工具正好补上那块短板。它在本地处理视频,不按固定帧率抽帧,而是每当场景切换就取一帧代表画面,顺手丢掉几乎重复的帧,再转录出音频内容。最后你会拿到一个清爽的文件夹,里面是图片、每帧对应的时间戳和文本,任何多模态模型都能直接读取。这样一来,录屏、课件、产品演示或者会议录像这类“画面和讲解同样重要”的场景,它都派得上用场。它也能单独当作普通的关键帧提取器使用;全程在本地跑,源视频不会被上传,之后你想把哪些帧或转录文本交给云端,主动权在自己手里。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目