#26 · 主分类: 语音合成与识别

moonshine

intent-recognition stt tts voice voice-recognition

极低延迟的语音转文字、意图识别和文字转语音,用于构建语音代理和界面

项目最后更新:08/28/26

GitHub Stars

11.0K

Forks数量

600

贡献者数量

20

许可证

Other

收录理由

做语音智能体,最头疼的往往不是单个识别或合成模块,而是它们之间来回衔接产生的延迟——一卡一顿,产品就显得僵硬。Moonshine 把整个口语交互链路收进一个本地库:流式语音转文字、文字转语音、意图识别、声音克隆、说话人分离全都有,想做个能开口对话的原型,不必再东拼西凑接多个服务。所有处理都在设备端完成,不要求注册账号,也不需要 API 密钥,对隐私敏感的场景很友好;模型在用户还在说话时就开始干活,响应延迟被压得很低。跨平台能力是它的一大亮点:同一套核心跑在手机、桌面、树莓派甚至嵌入式硬件上,最小模型只有 1MB 左右,约束严苛的设备也能塞进去。和 Whisper 做实时转写对比时,它给出了具体的准确率数据,团队可以快速验证;想做边缘设备上的低延迟语音助手,它提供的上层 API 开箱即用,声音克隆、命令识别这类常见需求不用自己从头搭。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目