语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 1 |
whisper.cpp
OpenAI Whisper 模型的 C/C++ 移植版 |
53.3K | 6.1K | 08/29/26 | MIT |
| 2 |
Real-Time-Voice-Cloning
在5秒内克隆声音,实时生成任意语音 |
60.1K | 9.4K | 03/09/26 | Other |
| 3 |
VibeVoice
开源前沿语音AI |
53.3K | 6.0K | 07/24/26 | MIT |
| 4 |
voicebox
开源AI语音工作室。克隆、听写、创作。 |
51.8K | 6.5K | 08/09/26 | MIT |
| 5 |
TTS
🐸💬 - 用于文本转语音的深度学习工具包,在研究和生产中久经考验。 |
46.0K | 6.1K | 08/16/24 | MPL-2.0 |
| 6 |
ChatTTS
面向日常对话的生成式语音模型。 |
39.8K | 4.3K | 04/10/26 | AGPL-3.0 |
| 7 |
MockingBird
🚀在5秒内克隆声音,实时生成任意语音 |
36.9K | 5.2K | 03/03/26 | Other |
| 8 |
meetily
隐私优先的AI会议助手,提供4倍更快的实时转录、说话人分离和Ollama摘要,完全本地且开源。 |
30.1K | 3.2K | 08/29/26 | MIT |
| 9 |
spleeter
Deezer 源分离库,包含预训练模型。 |
28.4K | 3.1K | 06/18/26 | MIT |
| 10 |
whisperX
WhisperX: 具有词级时间戳(及说话人分离)的自动语音识别 |
23.8K | 2.4K | 07/13/26 | BSD-2-Clause |
| 11 |
faster-whisper
基于CTranslate2的更快Whisper转录 |
25.1K | 2.0K | 11/19/25 | MIT |
| 12 |
CosyVoice
多语言大型语音生成模型,提供推理、训练和部署全栈能力。 |
23.1K | 2.6K | 05/25/26 | Apache-2.0 |
| 13 |
Speech
一个可扩展的生成式AI框架,专为从事大型语言模型、多模态和语音AI(自动语音识别和文本转语音)的研究人员和开发者设计。 |
18.4K | 3.6K | 08/29/26 | Apache-2.0 |
| 14 |
FunASR
开源语音识别工具包,用于训练、推理、流式ASR、VAD、标点、说话人分离流水线,以及OpenAI兼容/MCP服务。 |
20.1K | 2.0K | 08/29/26 | MIT |
| 15 |
dia
一种能够一次性生成超逼真对话的TTS模型。 |
19.4K | 1.7K | 11/19/25 | Apache-2.0 |
| 16 |
kaldi
kaldi-asr/kaldi 是 Kaldi 项目的官方仓库。 |
15.5K | 5.4K | 09/22/25 | Other |
| 17 |
vosk-api
适用于Android、iOS、Raspberry Pi和服务器的离线语音识别API,支持Python、Java、C#和Node |
15.1K | 1.8K | 08/09/26 | Apache-2.0 |
| 18 |
espnet
端到端语音处理工具包 |
9.9K | 2.4K | 08/28/26 | Apache-2.0 |
| 19 |
speechbrain
一个基于PyTorch的语音工具包 |
11.8K | 1.7K | 08/27/26 | Apache-2.0 |
| 20 |
PaddleSpeech
易于使用的语音工具包,包括自监督学习模型、带标点的SOTA/流式ASR、带文本前端的流式TTS、说话人验证系统、端到端语音翻译和关键词识别。荣获NAACL2022最佳演示奖。 |
12.7K | 2.0K | 08/12/26 | Apache-2.0 |