语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 41 |
wenet
生产优先且生产就绪的端到端语音识别工具包 |
5.2K | 1.2K | 06/15/26 | Apache-2.0 |
| 42 |
abogen
从EPUB、PDF和文本生成带同步字幕的有声书。 |
5.8K | 432 | 08/29/26 | MIT |
| 43 |
whisper-diarization
基于OpenAI Whisper的自动语音识别与说话人分离 |
5.6K | 503 | 08/15/26 | BSD-2-Clause |
| 44 |
porcupine
基于深度学习的设备端唤醒词检测 |
4.9K | 577 | 08/12/26 | Apache-2.0 |
| 45 |
audio
基于PyTorch的音频信号处理数据操作与转换。 |
2.9K | 795 | 08/29/26 | BSD-2-Clause |
| 46 |
Applio
一个简单、高质量的语音转换工具,专注于易用性和性能。 |
3.7K | 587 | 08/28/26 | MIT |
| 47 |
SmartSub
免费开源的视频字幕桌面应用:本地Whisper语音转文字、翻译、AI配音(带声音克隆)、字幕烧录,跨Windows/macOS/Linux GPU加速。 |
4.8K | 351 | 08/20/26 | MIT |
| 48 |
pocketsphinx
一个小型语音识别器 |
4.3K | 732 | 08/26/26 | Other |
| 49 |
Orpheus-TTS
迈向类人语音 |
6.3K | 535 | 12/05/25 | Apache-2.0 |
| 50 |
MOSS-TTS
开源的高保真语音和声音生成模型系列,支持长文本TTS、多说话人对话、声音设计、音效和实时流式处理。 |
4.0K | 366 | 07/26/26 | Apache-2.0 |
| 51 |
openless
(按住快捷键说话,松开即得润色后的文字) |
3.4K | 299 | 08/27/26 | MIT |
| 52 |
pyAudioAnalysis
Python音频分析库:特征提取、分类、分割及应用 |
6.3K | 1.2K | 08/04/25 | Apache-2.0 |
| 53 |
basic-pitch
轻量级但功能强大的音频转MIDI转换器,带有弯音检测 |
5.5K | 502 | 11/13/25 | Apache-2.0 |
| 54 |
elevenlabs-python
ElevenLabs API 的官方 Python SDK。 |
3.1K | 439 | 08/25/26 | MIT |
| 55 |
whisper-asr-webservice
OpenAI Whisper ASR Web服务 API |
3.3K | 584 | 08/09/26 | MIT |
| 56 |
fastrtc
用于实时通信的Python库 |
4.6K | 433 | 01/12/26 | MIT |
| 57 |
stt
语音识别转文字工具 / 一个离线运行的本地音视频转字幕工具,输出json、srt字幕、纯文字格式 |
4.8K | 499 | 01/22/26 | GPL-3.0 |
| 58 |
TTS
:robot: :speech_balloon: 深度学习用于文本转语音 (讨论论坛: https://discourse.mozilla.org/c/tts) |
10.2K | 1.3K | 11/09/23 | MPL-2.0 |
| 59 |
EmotiVoice
EmotiVoice 😊:一个多语音和提示控制的TTS引擎 |
8.5K | 756 | 08/13/24 | Apache-2.0 |
| 60 |
MeloTTS
高质量的多语言文本转语音库,由MyShell.ai开发。支持英语、西班牙语、法语、中文、日语和韩语。 |
7.6K | 1.1K | 12/24/24 | MIT |