语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 101 |
MMAudio
[CVPR 2025] MMAudio:驯服多模态联合训练以实现高质量视频到音频合成 |
2.3K | 267 | 02/23/26 | MIT |
| 102 |
alltalk_tts
AllTalk TTS 是一个基于 Coqui 的文本转语音引擎,具有高级功能,如模型微调、低显存支持、DeepSpeed 加速以及用于第三方应用的 JSON API 集成。 |
2.4K | 285 | 01/09/26 | AGPL-3.0 |
| 103 |
Speech-AI-Forge
🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器和基于 Gradio 的 WebUI。 |
1.4K | 189 | 05/21/26 | AGPL-3.0 |
| 104 |
conformer
[非官方] PyTorch实现《Conformer:用于语音识别的卷积增强Transformer》(INTERSPEECH 2020) |
1.1K | 192 | 06/29/26 | Apache-2.0 |
| 105 |
IMS-Toucan
可控且快速的文本转语音,支持超过7000种语言! |
2.2K | 316 | 01/25/26 | Apache-2.0 |
| 106 |
vits
VITS:条件变分自编码器与对抗学习用于端到端文本到语音合成 |
7.9K | 1.4K | 12/06/23 | MIT |
| 107 |
FireRedASR
开源工业级ASR模型,支持普通话、中文方言和英语,在公开普通话ASR基准上达到新SOTA,同时具备出色的歌词识别能力。 |
2.0K | 165 | 02/25/26 | Apache-2.0 |
| 108 |
Whisper-Finetune
微调Whisper语音识别模型,支持无时间戳数据训练、带时间戳数据训练及无语音数据训练。加速推理,支持Web部署、Windows桌面部署及Android部署。 |
1.2K | 223 | 05/08/26 | Apache-2.0 |
| 109 |
OuteTTS
OuteTTS模型的接口 |
1.4K | 118 | 03/23/26 | Apache-2.0 |
| 110 |
index-tts-vllm
为IndexTTS添加了vLLM支持,以实现更快的推理。 |
1.2K | 174 | 04/13/26 | Apache-2.0 |
| 111 |
VibeVoice-ComfyUI
为微软的VibeVoice文本转语音模型提供全面的ComfyUI集成,使您能够在ComfyUI工作流程中直接实现高质量的单人和多说话人语音合成。 |
1.6K | 249 | 02/18/26 | MIT |
| 112 |
whisper-ctranslate2
基于CTranslate2的Whisper命令行客户端,与原始OpenAI客户端兼容。 |
1.3K | 128 | 02/14/26 | MIT |
| 113 |
distil-whisper
用于语音识别的 Whisper 蒸馏变体。速度快 6 倍,体积小 50%,词错误率在 1% 以内。 |
4.1K | 357 | 01/08/25 | MIT |
| 114 |
DeepFilterNet
基于深度滤波的噪声抑制 |
4.6K | 508 | 10/17/24 | Other |
| 115 |
sherpa-ncnn
使用下一代Kaldi和ncnn进行实时语音识别和语音活动检测(VAD),无需互联网连接。支持iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A等。 |
1.8K | 218 | 10/20/25 | Apache-2.0 |
| 116 |
pykaldi
Kaldi 的 Python 封装 |
1.0K | 247 | 11/30/25 | Apache-2.0 |
| 117 |
Whisperboard
开源 iOS 应用,让移动设备上的高质量语音转录更易用。 |
1.1K | 114 | 12/18/25 | GPL-3.0 |
| 118 |
vosk-android-demo
使用Vosk库的Android离线语音识别。 |
1.1K | 277 | 12/08/25 | Apache-2.0 |
| 119 |
Verbi
一个模块化语音助手,用于通过OpenAI、Groq、Deepgram和本地选项实验最先进的转录、响应生成和文本转语音模型。 |
1.1K | 217 | 11/22/25 | MIT |
| 120 |
openai-edge-tts
免费、高质量文本转语音API端点,可替代OpenAI、Azure或ElevenLabs |
2.1K | 313 | 07/01/25 | GPL-3.0 |