#39 · 主分类: 语音合成与识别

argmax-oss-swift

inference ios macos pyannote qwen3-tts speaker-diarization speakerkit speech-recognition speech-to-text swift text-to-speech transformers ttskit whisper whisperkit

面向Apple Silicon的端侧语音AI

项目最后更新:08/13/26

GitHub Stars

6.3K

Forks数量

606

贡献者数量

42

许可证

MIT

收录理由

语音识别、说话人分离和文本转语音通常意味着把音频上传到云端接口,但 Argmax 的开源 SDK 将这三项能力全部打包进一个面向 macOS 和 iOS 的 Swift 包里,完全在设备本地运行。Whisper 负责语音转文字,Pyannote 负责区分不同说话人,Qwen 负责文本转语音,一条带说话人标签的完整转写流程可以在 Apple Silicon 上端到端跑完,音频数据全程不出设备。这种设计对隐私保护、离线场景以及避免按分钟计费的 API 开销都很有价值,也省去了团队自己拼接多次网络请求的麻烦。在决定是否接入托管服务之前,用它来感受一下苹果硬件上本地语音 AI 目前的实际水平,是个很直观的参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目