语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 121 |
julius
开源大词汇量连续语音识别引擎 |
1.9K | 304 | 06/16/25 | BSD-3-Clause |
| 122 |
metavoice-src
用于类人、富有表现力的 TTS 的基础模型 |
4.2K | 691 | 07/30/24 | Apache-2.0 |
| 123 |
NeuralNote
用于音频到MIDI转录的音频插件,使用深度学习。 |
2.9K | 190 | 01/16/25 | Apache-2.0 |
| 124 |
vosk-server
基于Vosk和Kaldi库的WebSocket、gRPC和WebRTC语音识别服务器 |
1.3K | 318 | 07/25/25 | Apache-2.0 |
| 125 |
audiolm-pytorch
AudioLM的PyTorch实现,这是一种出自Google Research的SOTA语言建模方法,用于音频生成。 |
2.6K | 277 | 01/12/25 | MIT |
| 126 |
whisper-jax
JAX实现OpenAI的Whisper模型,在TPU上速度提升可达70倍。 |
4.7K | 411 | 04/03/24 | Apache-2.0 |
| 127 |
whisper-web
ML驱动的语音识别,直接在浏览器中运行 |
3.3K | 426 | 10/01/24 | MIT |
| 128 |
StreamSpeech
StreamSpeech是一个“一体化”无缝模型,用于离线同步语音识别、语音翻译和语音合成。 |
1.3K | 105 | 06/29/25 | MIT |
| 129 |
soundstorm-pytorch
在Pytorch中实现Google Deepmind的SoundStorm,高效并行音频生成 |
1.5K | 94 | 04/24/25 | MIT |
| 130 |
audio-webui
用于不同音频相关神经网络的Web界面 |
1.2K | 113 | 05/19/25 | MIT |
| 131 |
autosub
[不再维护] 命令行工具,用于为任意视频文件自动生成字幕。 |
4.2K | 1.6K | 03/22/24 | MIT |
| 132 |
STT
🐸STT - 用于语音转文本的深度学习工具包。训练和部署STT模型从未如此简单。 |
2.6K | 296 | 03/11/24 | MPL-2.0 |
| 133 |
hifi-gan
HiFi-GAN:用于高效高保真语音合成的生成对抗网络 |
2.4K | 557 | 07/27/24 | MIT |
| 134 |
auto-subtitle
自动为任何视频生成并叠加字幕。 |
2.3K | 365 | 07/12/24 | MIT |
| 135 |
masr
中文语音识别;普通话自动语音识别 |
2.0K | 477 | 07/25/24 | Other |
| 136 |
vocal-remover
基于深度神经网络的人声移除器 |
1.8K | 256 | 07/23/24 | MIT |
| 137 |
whisper-writer
💬📝 一个使用OpenAI Whisper语音识别模型的小型听写应用。 |
1.1K | 196 | 08/24/24 | GPL-3.0 |
| 138 |
kaldi-gstreamer-server
基于Kaldi工具包和GStreamer框架的实时全双工语音识别服务器。 |
1.1K | 338 | 06/08/24 | BSD-2-Clause |
| 139 |
SpeechT5
统一模态语音-文本预训练用于口语处理 |
1.4K | 135 | 04/24/24 | MIT |
| 140 |
tensorflow-speech-recognition
🎙使用TensorFlow深度学习框架进行语音识别,采用序列到序列神经网络 |
2.2K | 628 | 01/17/24 | Other |