#245 · 主分类: AI代理与自动化
Vision-Agents
Stream 开放视觉代理。快速构建语音和视觉代理,支持任意模型或视频提供商。利用 Stream 的边缘网络实现超低延迟。
项目最后更新:08/27/26
GitHub Stars
8.1K
Forks数量
680
贡献者数量
31
许可证
Apache-2.0
收录理由
想做一个能看着实时视频画面并开口回应的对话代理,通常得自己把WebRTC流、语音模型和视觉检测拼在一起,工作量大且容易出错。Vision Agents把这些组件收进一个Python框架里,几十行代码就能搭出把YOLO这类快速检测器和实时大模型配在一起的原型。它保留了各家模型厂商的原生调用方式,所以能直接用OpenAI、Gemini或Claude的最新模型,不用套一层私有封装。框架还提供可插拔的视觉流水线、说话人切换检测、电话和工具调用支持,跑在Stream的边缘网络或其他WebRTC服务商上。对做直播陪练、远程监控这类对延迟敏感的场景,这是个挺实在的起步基础。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。