语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 21–40 项,共 152 个

排名 项目 Stars Forks
21 voice-pro

面向创作者和开发者的Gradio WebUI,支持关键TTS(Edge-TTS、kokoro)和零样本语音克隆(E2 & F5-TTS、CosyVoice),集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

12.7K 1.8K
22 VoiceStudio

VoiceStudio 是开源的、完全本地的 ElevenLabs 替代品——支持 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声书创作。

12.0K 1.9K
23 VoiceStudio

VoiceStudio 是一款开源、完全本地的 ElevenLabs 替代品——支持646种语言的语音克隆、语音设计、视频配音、听写、转录和有声书创作。

12.0K 1.9K
24 WhisperLiveKit

实时本地语音转文字,支持流式ASR、说话人分离、翻译,以及兼容OpenAI/Deepgram的API。

11.0K 1.1K
25 FluidVoice

最快的 macOS 听写应用,唯一支持设备端 STT 和自定义训练 AI 增强模型。提供 Windows 预构建版本!本地 Wispr Flow 替代方案。在 X 上私信我们获取彩蛋 😉 - https://x.com/fluidvoiceapp

11.1K 768
26 moonshine

极低延迟的语音转文字、意图识别和文字转语音,用于构建语音代理和界面

11.0K 600
27 so-vits-svc-fork

so-vits-svc 的 fork,支持实时,改进的界面和更多功能。

9.3K 1.2K
28 SenseVoice

开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语种识别、情感识别和音频事件检测。

9.2K 814
29 speech_recognition

Python语音识别模块,支持多种引擎和API,在线和离线。

9.0K 2.4K
30 Bert-VITS2

vits2骨干,基于多语言BERT

8.8K 1.3K
31 mlx-audio

基于Apple MLX框架的TTS、STT和STS库,在Apple Silicon上实现高效语音分析。

7.8K 700
32 higgs-audio

Boson AI的文本-音频基础模型

8.3K 640
33 vibe

自行转录!

7.2K 498
34 ASRT_SpeechRecognition

基于深度学习的中文语音识别系统

8.4K 1.9K
35 annyang

💬 为你的网站提供语音识别

6.8K 1.0K
36 wav2letter

Facebook AI Research 的自动语音识别工具包

6.4K 988
37 CapsWriter-Offline

PC 端语音输入工具,离线识别,高准确率、低延迟,支持热词、LLM润色。按住CapsLock或鼠标侧键X2说话,松开自动上屏。

6.7K 613
38 pedalboard

🎛 🔊 一个用于音频的Python库。

6.3K 350
39 argmax-oss-swift

面向Apple Silicon的端侧语音AI

6.3K 606
40 openwhispr

语音转文字听写应用,支持本地(Nvidia Parakeet/Whisper)和云端模型(BYOK)。隐私优先,并跨平台可用。

5.8K 819