#39 · 主分类: 语音合成与识别
argmax-oss-swift
inference
ios
macos
pyannote
qwen3-tts
speaker-diarization
speakerkit
speech-recognition
speech-to-text
swift
text-to-speech
transformers
ttskit
whisper
whisperkit
面向Apple Silicon的端侧语音AI
项目最后更新:08/13/26
GitHub Stars
6.3K
Forks数量
606
贡献者数量
42
许可证
MIT
收录理由
语音识别、说话人分离和文本转语音通常意味着把音频上传到云端接口,但 Argmax 的开源 SDK 将这三项能力全部打包进一个面向 macOS 和 iOS 的 Swift 包里,完全在设备本地运行。Whisper 负责语音转文字,Pyannote 负责区分不同说话人,Qwen 负责文本转语音,一条带说话人标签的完整转写流程可以在 Apple Silicon 上端到端跑完,音频数据全程不出设备。这种设计对隐私保护、离线场景以及避免按分钟计费的 API 开销都很有价值,也省去了团队自己拼接多次网络请求的麻烦。在决定是否接入托管服务之前,用它来感受一下苹果硬件上本地语音 AI 目前的实际水平,是个很直观的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。