#178 · 主分类: AI代理与自动化
speech-to-speech
ai
assistant
language-model
machine-learning
python
speech
speech-synthesis
speech-to-text
speech-translation
使用开源模型构建语音代理
项目最后更新:08/28/26
GitHub Stars
12.9K
Forks数量
1.6K
贡献者数量
45
许可证
Apache-2.0
收录理由
如果你想要一个不依赖云端、能真正跑起来的语音助手,这个项目给出的是一条完整的对话服务链路,而不是一堆需要自己拼装的语音模型。它把语音活动检测、语音转文字、大语言模型和文字转语音按队列串起来,每个环节都能在命令行里随时替换,你可以先用托管推理起步,之后再把语言模型换到本地 vLLM 或 llama.cpp 上,其余部分不用动。对外提供 OpenAI Realtime 兼容的 WebSocket 接口,已经对接过该协议的应用几乎不用改代码就能切换过来。这套管线已经在真实消费级机器人上支撑着数千台设备,说明它在实际的人机轮换和延迟压力下经得起考验,而不只是演示脚本能跑通。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。