#90 · 主分类: 语音合成与识别

speech-swift

apple-silicon asr coreml ios macos mlx neural-engine on-device speaker-diarization speech-enhancement speech-recognition speech-to-speech swift text-to-speech tts voice-activity-detection

面向Apple Silicon的AI语音工具包——基于MLX和CoreML的ASR、TTS、语音到语音、VAD和说话人分离

项目最后更新:08/28/26

GitHub Stars

1.2K

Forks数量

153

贡献者数量

29

许可证

Apache-2.0

收录理由

这个Swift包很适合Mac和iOS团队,他们想要真正的语音功能,又不想把音频送到云端。库把自动语音识别、文本转语音、声音克隆、说话人分离和语音活动检测打包在一起,通过MLX和CoreML在Apple Silicon上本地运行,录音数据始终留在设备里。对听写、转写和语音代理这类对隐私有硬性要求的产品来说,这点很实用。模型选择很丰富,从针对神经引擎优化的轻量CoreML版本,到更大的MLX模型,都有数十种ASR和TTS可选,还有实时因子低的流式变体,适合实时对话场景。已经有十几个公开应用基于它构建,除了文档之外,你还能找到可用的参考代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目