语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 21 |
voice-pro
面向创作者和开发者的Gradio WebUI,支持关键TTS(Edge-TTS、kokoro)和零样本语音克隆(E2 & F5-TTS、CosyVoice),集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。 |
12.7K | 1.8K | 07/13/26 | GPL-3.0 |
| 22 |
VoiceStudio
VoiceStudio 是开源的、完全本地的 ElevenLabs 替代品——支持 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声书创作。 |
12.0K | 1.9K | 08/28/26 | AGPL-3.0 |
| 23 |
VoiceStudio
VoiceStudio 是一款开源、完全本地的 ElevenLabs 替代品——支持646种语言的语音克隆、语音设计、视频配音、听写、转录和有声书创作。 |
12.0K | 1.9K | 08/28/26 | AGPL-3.0 |
| 24 |
WhisperLiveKit
实时本地语音转文字,支持流式ASR、说话人分离、翻译,以及兼容OpenAI/Deepgram的API。 |
11.0K | 1.1K | 08/29/26 | Apache-2.0 |
| 25 |
FluidVoice
最快的 macOS 听写应用,唯一支持设备端 STT 和自定义训练 AI 增强模型。提供 Windows 预构建版本!本地 Wispr Flow 替代方案。在 X 上私信我们获取彩蛋 😉 - https://x.com/fluidvoiceapp |
11.1K | 768 | 08/29/26 | GPL-3.0 |
| 26 |
moonshine
极低延迟的语音转文字、意图识别和文字转语音,用于构建语音代理和界面 |
11.0K | 600 | 08/28/26 | Other |
| 27 |
so-vits-svc-fork
so-vits-svc 的 fork,支持实时,改进的界面和更多功能。 |
9.3K | 1.2K | 08/29/26 | Other |
| 28 |
SenseVoice
开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语种识别、情感识别和音频事件检测。 |
9.2K | 814 | 08/27/26 | MIT |
| 29 |
speech_recognition
Python语音识别模块,支持多种引擎和API,在线和离线。 |
9.0K | 2.4K | 07/31/26 | BSD-3-Clause |
| 30 |
Bert-VITS2
vits2骨干,基于多语言BERT |
8.8K | 1.3K | 08/24/26 | AGPL-3.0 |
| 31 |
mlx-audio
基于Apple MLX框架的TTS、STT和STS库,在Apple Silicon上实现高效语音分析。 |
7.8K | 700 | 08/29/26 | MIT |
| 32 |
higgs-audio
Boson AI的文本-音频基础模型 |
8.3K | 640 | 06/05/26 | Apache-2.0 |
| 33 |
vibe
自行转录! |
7.2K | 498 | 08/28/26 | MIT |
| 34 |
ASRT_SpeechRecognition
基于深度学习的中文语音识别系统 |
8.4K | 1.9K | 04/10/26 | GPL-3.0 |
| 35 |
annyang
💬 为你的网站提供语音识别 |
6.8K | 1.0K | 08/05/26 | MIT |
| 36 |
wav2letter
Facebook AI Research 的自动语音识别工具包 |
6.4K | 988 | 08/28/26 | Other |
| 37 |
CapsWriter-Offline
PC 端语音输入工具,离线识别,高准确率、低延迟,支持热词、LLM润色。按住CapsLock或鼠标侧键X2说话,松开自动上屏。 |
6.7K | 613 | 08/26/26 | MIT |
| 38 |
pedalboard
🎛 🔊 一个用于音频的Python库。 |
6.3K | 350 | 08/29/26 | GPL-3.0 |
| 39 |
argmax-oss-swift
面向Apple Silicon的端侧语音AI |
6.3K | 606 | 08/13/26 | MIT |
| 40 |
openwhispr
语音转文字听写应用,支持本地(Nvidia Parakeet/Whisper)和云端模型(BYOK)。隐私优先,并跨平台可用。 |
5.8K | 819 | 08/29/26 | MIT |