语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 101–120 项,共 152 个

排名 项目 Stars Forks
101 MMAudio

[CVPR 2025] MMAudio:驯服多模态联合训练以实现高质量视频到音频合成

2.3K 267
102 alltalk_tts

AllTalk TTS 是一个基于 Coqui 的文本转语音引擎,具有高级功能,如模型微调、低显存支持、DeepSpeed 加速以及用于第三方应用的 JSON API 集成。

2.4K 285
103 Speech-AI-Forge

🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器和基于 Gradio 的 WebUI。

1.4K 189
104 conformer

[非官方] PyTorch实现《Conformer:用于语音识别的卷积增强Transformer》(INTERSPEECH 2020)

1.1K 192
105 IMS-Toucan

可控且快速的文本转语音,支持超过7000种语言!

2.2K 316
106 vits

VITS:条件变分自编码器与对抗学习用于端到端文本到语音合成

7.9K 1.4K
107 FireRedASR

开源工业级ASR模型,支持普通话、中文方言和英语,在公开普通话ASR基准上达到新SOTA,同时具备出色的歌词识别能力。

2.0K 165
108 Whisper-Finetune

微调Whisper语音识别模型,支持无时间戳数据训练、带时间戳数据训练及无语音数据训练。加速推理,支持Web部署、Windows桌面部署及Android部署。

1.2K 223
109 OuteTTS

OuteTTS模型的接口

1.4K 118
110 index-tts-vllm

为IndexTTS添加了vLLM支持,以实现更快的推理。

1.2K 174
111 VibeVoice-ComfyUI

为微软的VibeVoice文本转语音模型提供全面的ComfyUI集成,使您能够在ComfyUI工作流程中直接实现高质量的单人和多说话人语音合成。

1.6K 249
112 whisper-ctranslate2

基于CTranslate2的Whisper命令行客户端,与原始OpenAI客户端兼容。

1.3K 128
113 distil-whisper

用于语音识别的 Whisper 蒸馏变体。速度快 6 倍,体积小 50%,词错误率在 1% 以内。

4.1K 357
114 DeepFilterNet

基于深度滤波的噪声抑制

4.6K 508
115 sherpa-ncnn

使用下一代Kaldi和ncnn进行实时语音识别和语音活动检测(VAD),无需互联网连接。支持iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A等。

1.8K 218
116 pykaldi

Kaldi 的 Python 封装

1.0K 247
117 Whisperboard

开源 iOS 应用,让移动设备上的高质量语音转录更易用。

1.1K 114
118 vosk-android-demo

使用Vosk库的Android离线语音识别。

1.1K 277
119 Verbi

一个模块化语音助手,用于通过OpenAI、Groq、Deepgram和本地选项实验最先进的转录、响应生成和文本转语音模型。

1.1K 217
120 openai-edge-tts

免费、高质量文本转语音API端点,可替代OpenAI、Azure或ElevenLabs

2.1K 313