#31 · 主分类: 语音合成与识别
mlx-audio
基于Apple MLX框架的TTS、STT和STS库,在Apple Silicon上实现高效语音分析。
项目最后更新:08/29/26
GitHub Stars
7.8K
Forks数量
700
贡献者数量
114
许可证
MIT
收录理由
Apple Silicon 用户现在可以用一套基于 MLX 的原生库同时处理文本转语音、语音转文本和语音到语音的任务。无论是用 Kokoro 还是 Qwen3-TTS 这类模型合成人声,还是把录音转成文字,甚至把两者串联成对话流程,都不再需要东拼西凑多个工具。本地部署也很现实:3-bit 到 8-bit 的量化选项能有效控制模型体积,加上 Swift 包,iOS 和 macOS 应用也能直接调用同样的能力。另外还提供了兼容 OpenAI 的 REST API 和带音频可视化的交互式网页界面,方便快速原型验证或接入现有服务。对已经基于 M 系列芯片做开发的团队来说,用 Python 或 Swift 交付实时语音功能,这条路径相当顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。