语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 81 |
dsnote
Speech Note Linux 应用。支持笔记、阅读和翻译,具备离线语音转文字、文字转语音和机器翻译功能。 |
1.6K | 73 | 08/27/26 | MPL-2.0 |
| 82 |
elevenlabs-mcp
ElevenLabs官方MCP服务器 |
1.5K | 251 | 08/20/26 | MIT |
| 83 |
diart
一个用于构建AI驱动的实时音频应用的Python包 |
2.0K | 165 | 06/19/26 | MIT |
| 84 |
audiomentations
一个用于音频数据增强的Python库。有助于让音频机器学习模型在现实世界中表现良好,而不仅仅是在实验室中。 |
2.3K | 220 | 04/13/26 | MIT |
| 85 |
amical
🎙️ AI听写应用 - 开源且本地优先 ⚡ 打字速度提高3倍,无需键盘。🆓 由开源模型驱动,离线可用,快速准确。 |
1.5K | 139 | 08/26/26 | MIT |
| 86 |
voxtype
Wayland合成器的即按即说语音转文字 |
1.3K | 100 | 08/29/26 | MIT |
| 87 |
Fun-ASR
开源基于LLM的ASR模型系列,支持中文、方言、口音和多语言语音,提供FunASR、vLLM、流式和llama.cpp运行时。 |
1.5K | 148 | 08/27/26 | Apache-2.0 |
| 88 |
descript-audio-codec
最先进的音频编解码器,具有90倍压缩比。支持44.1kHz、24kHz和16kHz单声道/立体声音频。 |
1.8K | 188 | 07/16/26 | MIT |
| 89 |
SALMONN
SALMONN系列:先进的多模态大语言模型套件 |
1.5K | 124 | 08/24/26 | Apache-2.0 |
| 90 |
speech-swift
面向Apple Silicon的AI语音工具包——基于MLX和CoreML的ASR、TTS、语音到语音、VAD和说话人分离 |
1.2K | 153 | 08/28/26 | Apache-2.0 |
| 91 |
CrisperWhisper
可控转录:逐字(包括每个词、填充词、停顿、口吃、发声)或意图(说话者想表达的意思,优化可读性),附带词级时间戳。 |
1.4K | 86 | 08/23/26 | Other |
| 92 |
ComfyUI-Qwen-TTS
Qwen3-TTS的ComfyUI简单实现 |
1.9K | 204 | 06/03/26 | Other |
| 93 |
Whisper-WebUI
一个用于轻松使用whisper模型生成字幕的Web界面。 |
2.9K | 434 | 12/29/25 | Apache-2.0 |
| 94 |
TTS-Audio-Suite
一个ComfyUI自定义节点套件,支持多引擎、多语言文本转语音和语音转换,并附带SRT时间轴和音频工具。 |
1.2K | 140 | 08/28/26 | Other |
| 95 |
MOSS-TTSD
MOSS-TTSD 是一个口语对话生成模型,专为表现力丰富的多说话人合成而设计。它具备长上下文建模、灵活的说话人控制以及多语言支持,并可从短音频参考实现零样本语音克隆。 |
1.4K | 136 | 07/26/26 | Apache-2.0 |
| 96 |
whisper-standalone-win
为不想折腾Python的用户提供的Whisper和Faster-Whisper独立可执行文件。 |
3.2K | 165 | 11/07/25 | Other |
| 97 |
StyleTTS2
StyleTTS 2:通过风格扩散和大型语音语言模型的对抗训练实现人类级文本到语音合成 |
6.3K | 700 | 08/10/24 | MIT |
| 98 |
Irene-Voice-Assistant
伊琳娜 - 俄语语音助手,可离线工作。支持通过插件扩展技能。 |
1.2K | 152 | 07/26/26 | Other |
| 99 |
TensorFlowASR
:zap: TensorFlowASR:在Tensorflow 2中近乎最先进的自动语音识别。支持可以使用字符或子词的语言。 |
1.0K | 238 | 08/05/26 | Apache-2.0 |
| 100 |
obs-localvocal
OBS插件,用于本地语音识别和AI字幕生成 |
1.6K | 119 | 05/20/26 | GPL-2.0 |