语音合成与识别
语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。
共 152 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 61 |
YuE
YuE: 开源全曲音乐生成基础模型,类似Suno.ai但开放 |
6.4K | 757 | 06/04/25 | Apache-2.0 |
| 62 |
AI-Video-Transcriber
使用AI转录和总结视频与播客。开源、跨平台,支持多种语言。 |
3.2K | 416 | 08/23/26 | Apache-2.0 |
| 63 |
TTS-WebUI
一个集成了 Gradio 和 React 的 WebUI,支持 ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T 和 Bark 等扩展! |
3.2K | 329 | 07/27/26 | MIT |
| 64 |
vexa
开源会议转录API,支持Google Meet、Microsoft Teams和Zoom。自动加入机器人、实时WebSocket转录、用于AI代理的MCP服务器。可自托管或使用托管SaaS。 |
2.7K | 448 | 08/29/26 | Apache-2.0 |
| 65 |
willow
开源、本地、自托管的语音助手,可替代亚马逊Echo和谷歌Home |
3.1K | 129 | 08/04/26 | Apache-2.0 |
| 66 |
whishper
将任何音频转录为文本,翻译和编辑字幕,100%本地化,带Web界面。由whisper模型驱动! |
3.1K | 179 | 07/31/26 | AGPL-3.0 |
| 67 |
whisper-timestamped
多语言自动语音识别,具有词级时间戳和置信度 |
2.8K | 211 | 08/17/26 | AGPL-3.0 |
| 68 |
aeneas
aeneas 是一个 Python/C 库和一组工具,用于自动同步音频和文本(又称强制对齐) |
2.9K | 275 | 07/25/26 | AGPL-3.0 |
| 69 |
audio.cpp
一个由ggml驱动的全功能纯C++音频模型推理引擎,支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化,无Python依赖。 |
2.1K | 254 | 08/29/26 | Other |
| 70 |
VieNeu-TTS
越南语TTS,支持即时语音克隆 • 设备端运行 • 实时CPU推理 • 24kHz音频质量 • 将文本转换为越南语语音 • 越南语文本转语音 • 越南语TTS |
2.4K | 732 | 08/25/26 | Apache-2.0 |
| 71 |
Scriberr
自托管AI音频转写 |
3.0K | 251 | 06/01/26 | MIT |
| 72 |
wukong-robot
🤖 wukong-robot 是一个简单、灵活、优雅的中文语音对话机器人/智能音箱项目,支持ChatGPT多轮对话能力,还可能是首个支持脑机交互的开源智能音箱项目。 |
7.1K | 1.4K | 10/25/24 | MIT |
| 73 |
AudioNotes
快速提取音视频内容,整理成一份结构化的markdown笔记 |
2.5K | 365 | 08/19/26 | MIT |
| 74 |
asteroid
面向研究人员的基于PyTorch的音频源分离工具包 |
2.6K | 450 | 05/13/26 | MIT |
| 75 |
WhisperJAV
ASR/STT字幕生成器。使用Qwen3-ASR、本地LLM、Whisper、TEN-VAD。针对JAV抗噪。 |
2.2K | 183 | 08/22/26 | MIT |
| 76 |
audioFlux
用于音频和音乐分析、特征提取的库。 |
3.4K | 146 | 03/06/26 | MIT |
| 77 |
lhotse
用于处理机器学习项目中多模态数据的工具。 |
1.1K | 277 | 08/26/26 | Apache-2.0 |
| 78 |
Android-MVVM-Architecture-Android-Voice-AI-SDK
语音AI SDK是一个可复用的Android库,让任何应用在几分钟内获得完整的语音驱动AI对话流程。语音助手 + Android语音AI + SDK + MVVM + Kotlin |
2.6K | 614 | 06/01/26 | Other |
| 79 |
ElatoAI
实时语音AI,在Arduino ESP32上支持100+模型,具备安全Websockets和边缘函数,适用于AI伴侣和设备。 |
1.9K | 240 | 08/19/26 | Other |
| 80 |
ClearerVoice-Studio
一个由AI驱动的语音处理工具包和开源SOTA预训练模型,支持语音增强、分离和目标说话人提取等。 |
4.5K | 365 | 08/14/25 | Apache-2.0 |