语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 61–80 项,共 152 个

排名 项目 Stars Forks
61 YuE

YuE: 开源全曲音乐生成基础模型,类似Suno.ai但开放

6.4K 757
62 AI-Video-Transcriber

使用AI转录和总结视频与播客。开源、跨平台,支持多种语言。

3.2K 416
63 TTS-WebUI

一个集成了 Gradio 和 React 的 WebUI,支持 ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T 和 Bark 等扩展!

3.2K 329
64 vexa

开源会议转录API,支持Google Meet、Microsoft Teams和Zoom。自动加入机器人、实时WebSocket转录、用于AI代理的MCP服务器。可自托管或使用托管SaaS。

2.7K 448
65 willow

开源、本地、自托管的语音助手,可替代亚马逊Echo和谷歌Home

3.1K 129
66 whishper

将任何音频转录为文本,翻译和编辑字幕,100%本地化,带Web界面。由whisper模型驱动!

3.1K 179
67 whisper-timestamped

多语言自动语音识别,具有词级时间戳和置信度

2.8K 211
68 aeneas

aeneas 是一个 Python/C 库和一组工具,用于自动同步音频和文本(又称强制对齐)

2.9K 275
69 audio.cpp

一个由ggml驱动的全功能纯C++音频模型推理引擎,支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化,无Python依赖。

2.1K 254
70 VieNeu-TTS

越南语TTS,支持即时语音克隆 • 设备端运行 • 实时CPU推理 • 24kHz音频质量 • 将文本转换为越南语语音 • 越南语文本转语音 • 越南语TTS

2.4K 732
71 Scriberr

自托管AI音频转写

3.0K 251
72 wukong-robot

🤖 wukong-robot 是一个简单、灵活、优雅的中文语音对话机器人/智能音箱项目,支持ChatGPT多轮对话能力,还可能是首个支持脑机交互的开源智能音箱项目。

7.1K 1.4K
73 AudioNotes

快速提取音视频内容,整理成一份结构化的markdown笔记

2.5K 365
74 asteroid

面向研究人员的基于PyTorch的音频源分离工具包

2.6K 450
75 WhisperJAV

ASR/STT字幕生成器。使用Qwen3-ASR、本地LLM、Whisper、TEN-VAD。针对JAV抗噪。

2.2K 183
76 audioFlux

用于音频和音乐分析、特征提取的库。

3.4K 146
77 lhotse

用于处理机器学习项目中多模态数据的工具。

1.1K 277
78 Android-MVVM-Architecture-Android-Voice-AI-SDK

语音AI SDK是一个可复用的Android库,让任何应用在几分钟内获得完整的语音驱动AI对话流程。语音助手 + Android语音AI + SDK + MVVM + Kotlin

2.6K 614
79 ElatoAI

实时语音AI,在Arduino ESP32上支持100+模型,具备安全Websockets和边缘函数,适用于AI伴侣和设备。

1.9K 240
80 ClearerVoice-Studio

一个由AI驱动的语音处理工具包和开源SOTA预训练模型,支持语音增强、分离和目标说话人提取等。

4.5K 365