#245 · 主分类: AI代理与自动化

Vision-Agents

agentic-ai agents ai ai-agents realtime stt tts video-agents video-ai vision-ai voice-ai

Stream 开放视觉代理。快速构建语音和视觉代理,支持任意模型或视频提供商。利用 Stream 的边缘网络实现超低延迟。

项目最后更新:08/27/26

GitHub Stars

8.1K

Forks数量

680

贡献者数量

31

许可证

Apache-2.0

收录理由

想做一个能看着实时视频画面并开口回应的对话代理,通常得自己把WebRTC流、语音模型和视觉检测拼在一起,工作量大且容易出错。Vision Agents把这些组件收进一个Python框架里,几十行代码就能搭出把YOLO这类快速检测器和实时大模型配在一起的原型。它保留了各家模型厂商的原生调用方式,所以能直接用OpenAI、Gemini或Claude的最新模型,不用套一层私有封装。框架还提供可插拔的视觉流水线、说话人切换检测、电话和工具调用支持,跑在Stream的边缘网络或其他WebRTC服务商上。对做直播陪练、远程监控这类对延迟敏感的场景,这是个挺实在的起步基础。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目