语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 121–140 项,共 152 个

排名 项目 Stars Forks
121 julius

开源大词汇量连续语音识别引擎

1.9K 304
122 metavoice-src

用于类人、富有表现力的 TTS 的基础模型

4.2K 691
123 NeuralNote

用于音频到MIDI转录的音频插件,使用深度学习。

2.9K 190
124 vosk-server

基于Vosk和Kaldi库的WebSocket、gRPC和WebRTC语音识别服务器

1.3K 318
125 audiolm-pytorch

AudioLM的PyTorch实现,这是一种出自Google Research的SOTA语言建模方法,用于音频生成。

2.6K 277
126 whisper-jax

JAX实现OpenAI的Whisper模型,在TPU上速度提升可达70倍。

4.7K 411
127 whisper-web

ML驱动的语音识别,直接在浏览器中运行

3.3K 426
128 StreamSpeech

StreamSpeech是一个“一体化”无缝模型,用于离线同步语音识别、语音翻译和语音合成。

1.3K 105
129 soundstorm-pytorch

在Pytorch中实现Google Deepmind的SoundStorm,高效并行音频生成

1.5K 94
130 audio-webui

用于不同音频相关神经网络的Web界面

1.2K 113
131 autosub

[不再维护] 命令行工具,用于为任意视频文件自动生成字幕。

4.2K 1.6K
132 STT

🐸STT - 用于语音转文本的深度学习工具包。训练和部署STT模型从未如此简单。

2.6K 296
133 hifi-gan

HiFi-GAN:用于高效高保真语音合成的生成对抗网络

2.4K 557
134 auto-subtitle

自动为任何视频生成并叠加字幕。

2.3K 365
135 masr

中文语音识别;普通话自动语音识别

2.0K 477
136 vocal-remover

基于深度神经网络的人声移除器

1.8K 256
137 whisper-writer

💬📝 一个使用OpenAI Whisper语音识别模型的小型听写应用。

1.1K 196
138 kaldi-gstreamer-server

基于Kaldi工具包和GStreamer框架的实时全双工语音识别服务器。

1.1K 338
139 SpeechT5

统一模态语音-文本预训练用于口语处理

1.4K 135
140 tensorflow-speech-recognition

🎙使用TensorFlow深度学习框架进行语音识别,采用序列到序列神经网络

2.2K 628