#178 · 主分类: AI代理与自动化

speech-to-speech

ai assistant language-model machine-learning python speech speech-synthesis speech-to-text speech-translation

使用开源模型构建语音代理

项目最后更新:08/28/26

GitHub Stars

12.9K

Forks数量

1.6K

贡献者数量

45

许可证

Apache-2.0

收录理由

如果你想要一个不依赖云端、能真正跑起来的语音助手,这个项目给出的是一条完整的对话服务链路,而不是一堆需要自己拼装的语音模型。它把语音活动检测、语音转文字、大语言模型和文字转语音按队列串起来,每个环节都能在命令行里随时替换,你可以先用托管推理起步,之后再把语言模型换到本地 vLLM 或 llama.cpp 上,其余部分不用动。对外提供 OpenAI Realtime 兼容的 WebSocket 接口,已经对接过该协议的应用几乎不用改代码就能切换过来。这套管线已经在真实消费级机器人上支撑着数千台设备,说明它在实际的人机轮换和延迟压力下经得起考验,而不只是演示脚本能跑通。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目