语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 1–20 项,共 152 个

排名 项目 Stars Forks
1 whisper.cpp

OpenAI Whisper 模型的 C/C++ 移植版

53.3K 6.1K
2 Real-Time-Voice-Cloning

在5秒内克隆声音,实时生成任意语音

60.1K 9.4K
3 VibeVoice

开源前沿语音AI

53.3K 6.0K
4 voicebox

开源AI语音工作室。克隆、听写、创作。

51.8K 6.5K
5 TTS

🐸💬 - 用于文本转语音的深度学习工具包,在研究和生产中久经考验。

46.0K 6.1K
6 ChatTTS

面向日常对话的生成式语音模型。

39.8K 4.3K
7 MockingBird

🚀在5秒内克隆声音,实时生成任意语音

36.9K 5.2K
8 meetily

隐私优先的AI会议助手,提供4倍更快的实时转录、说话人分离和Ollama摘要,完全本地且开源。

30.1K 3.2K
9 spleeter

Deezer 源分离库,包含预训练模型。

28.4K 3.1K
10 whisperX

WhisperX: 具有词级时间戳(及说话人分离)的自动语音识别

23.8K 2.4K
11 faster-whisper

基于CTranslate2的更快Whisper转录

25.1K 2.0K
12 CosyVoice

多语言大型语音生成模型,提供推理、训练和部署全栈能力。

23.1K 2.6K
13 Speech

一个可扩展的生成式AI框架,专为从事大型语言模型、多模态和语音AI(自动语音识别和文本转语音)的研究人员和开发者设计。

18.4K 3.6K
14 FunASR

开源语音识别工具包,用于训练、推理、流式ASR、VAD、标点、说话人分离流水线,以及OpenAI兼容/MCP服务。

20.1K 2.0K
15 dia

一种能够一次性生成超逼真对话的TTS模型。

19.4K 1.7K
16 kaldi

kaldi-asr/kaldi 是 Kaldi 项目的官方仓库。

15.5K 5.4K
17 vosk-api

适用于Android、iOS、Raspberry Pi和服务器的离线语音识别API,支持Python、Java、C#和Node

15.1K 1.8K
18 espnet

端到端语音处理工具包

9.9K 2.4K
19 speechbrain

一个基于PyTorch的语音工具包

11.8K 1.7K
20 PaddleSpeech

易于使用的语音工具包,包括自监督学习模型、带标点的SOTA/流式ASR、带文本前端的流式TTS、说话人验证系统、端到端语音翻译和关键词识别。荣获NAACL2022最佳演示奖。

12.7K 2.0K
< 上一页
/ 8
下一页 >