#90 · 主分类: 语音合成与识别
speech-swift
面向Apple Silicon的AI语音工具包——基于MLX和CoreML的ASR、TTS、语音到语音、VAD和说话人分离
项目最后更新:08/28/26
GitHub Stars
1.2K
Forks数量
153
贡献者数量
29
许可证
Apache-2.0
收录理由
这个Swift包很适合Mac和iOS团队,他们想要真正的语音功能,又不想把音频送到云端。库把自动语音识别、文本转语音、声音克隆、说话人分离和语音活动检测打包在一起,通过MLX和CoreML在Apple Silicon上本地运行,录音数据始终留在设备里。对听写、转写和语音代理这类对隐私有硬性要求的产品来说,这点很实用。模型选择很丰富,从针对神经引擎优化的轻量CoreML版本,到更大的MLX模型,都有数十种ASR和TTS可选,还有实时因子低的流式变体,适合实时对话场景。已经有十几个公开应用基于它构建,除了文档之外,你还能找到可用的参考代码。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。