#132 · 主分类: 计算机视觉
claude-real-video
claude
claude-code
cli
ffmpeg
keyframe-extraction
llm
multimodal
python
scene-detection
transcription
video-analysis
whisper
让Claude(或任何LLM)真正观看视频——从URL或本地文件获取场景感知、去重的帧+转录。本地运行,MIT许可。
项目最后更新:08/28/26
GitHub Stars
2.1K
Forks数量
184
贡献者数量
9
许可证
MIT
收录理由
当你在聊天框里丢进一个视频链接,大模型却只靠字幕文件回答你时,这个工具正好补上那块短板。它在本地处理视频,不按固定帧率抽帧,而是每当场景切换就取一帧代表画面,顺手丢掉几乎重复的帧,再转录出音频内容。最后你会拿到一个清爽的文件夹,里面是图片、每帧对应的时间戳和文本,任何多模态模型都能直接读取。这样一来,录屏、课件、产品演示或者会议录像这类“画面和讲解同样重要”的场景,它都派得上用场。它也能单独当作普通的关键帧提取器使用;全程在本地跑,源视频不会被上传,之后你想把哪些帧或转录文本交给云端,主动权在自己手里。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。