语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 81–100 项,共 152 个

排名 项目 Stars Forks
81 dsnote

Speech Note Linux 应用。支持笔记、阅读和翻译,具备离线语音转文字、文字转语音和机器翻译功能。

1.6K 73
82 elevenlabs-mcp

ElevenLabs官方MCP服务器

1.5K 251
83 diart

一个用于构建AI驱动的实时音频应用的Python包

2.0K 165
84 audiomentations

一个用于音频数据增强的Python库。有助于让音频机器学习模型在现实世界中表现良好,而不仅仅是在实验室中。

2.3K 220
85 amical

🎙️ AI听写应用 - 开源且本地优先 ⚡ 打字速度提高3倍,无需键盘。🆓 由开源模型驱动,离线可用,快速准确。

1.5K 139
86 voxtype

Wayland合成器的即按即说语音转文字

1.3K 100
87 Fun-ASR

开源基于LLM的ASR模型系列,支持中文、方言、口音和多语言语音,提供FunASR、vLLM、流式和llama.cpp运行时。

1.5K 148
88 descript-audio-codec

最先进的音频编解码器,具有90倍压缩比。支持44.1kHz、24kHz和16kHz单声道/立体声音频。

1.8K 188
89 SALMONN

SALMONN系列:先进的多模态大语言模型套件

1.5K 124
90 speech-swift

面向Apple Silicon的AI语音工具包——基于MLX和CoreML的ASR、TTS、语音到语音、VAD和说话人分离

1.2K 153
91 CrisperWhisper

可控转录:逐字(包括每个词、填充词、停顿、口吃、发声)或意图(说话者想表达的意思,优化可读性),附带词级时间戳。

1.4K 86
92 ComfyUI-Qwen-TTS

Qwen3-TTS的ComfyUI简单实现

1.9K 204
93 Whisper-WebUI

一个用于轻松使用whisper模型生成字幕的Web界面。

2.9K 434
94 TTS-Audio-Suite

一个ComfyUI自定义节点套件,支持多引擎、多语言文本转语音和语音转换,并附带SRT时间轴和音频工具。

1.2K 140
95 MOSS-TTSD

MOSS-TTSD 是一个口语对话生成模型,专为表现力丰富的多说话人合成而设计。它具备长上下文建模、灵活的说话人控制以及多语言支持,并可从短音频参考实现零样本语音克隆。

1.4K 136
96 whisper-standalone-win

为不想折腾Python的用户提供的Whisper和Faster-Whisper独立可执行文件。

3.2K 165
97 StyleTTS2

StyleTTS 2:通过风格扩散和大型语音语言模型的对抗训练实现人类级文本到语音合成

6.3K 700
98 Irene-Voice-Assistant

伊琳娜 - 俄语语音助手,可离线工作。支持通过插件扩展技能。

1.2K 152
99 TensorFlowASR

:zap: TensorFlowASR:在Tensorflow 2中近乎最先进的自动语音识别。支持可以使用字符或子词的语言。

1.0K 238
100 obs-localvocal

OBS插件,用于本地语音识别和AI字幕生成

1.6K 119