语音合成与识别

语音识别、语音合成与音频工具,Whisper API、ElevenLabs 的开源替代。

共 152 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 41–60 项,共 152 个

排名 项目 Stars Forks
41 wenet

生产优先且生产就绪的端到端语音识别工具包

5.2K 1.2K
42 abogen

从EPUB、PDF和文本生成带同步字幕的有声书。

5.8K 432
43 whisper-diarization

基于OpenAI Whisper的自动语音识别与说话人分离

5.6K 503
44 porcupine

基于深度学习的设备端唤醒词检测

4.9K 577
45 audio

基于PyTorch的音频信号处理数据操作与转换。

2.9K 795
46 Applio

一个简单、高质量的语音转换工具,专注于易用性和性能。

3.7K 587
47 SmartSub

免费开源的视频字幕桌面应用:本地Whisper语音转文字、翻译、AI配音(带声音克隆)、字幕烧录,跨Windows/macOS/Linux GPU加速。

4.8K 351
48 pocketsphinx

一个小型语音识别器

4.3K 732
49 Orpheus-TTS

迈向类人语音

6.3K 535
50 MOSS-TTS

开源的高保真语音和声音生成模型系列,支持长文本TTS、多说话人对话、声音设计、音效和实时流式处理。

4.0K 366
51 openless

(按住快捷键说话,松开即得润色后的文字)

3.4K 299
52 pyAudioAnalysis

Python音频分析库:特征提取、分类、分割及应用

6.3K 1.2K
53 basic-pitch

轻量级但功能强大的音频转MIDI转换器,带有弯音检测

5.5K 502
54 elevenlabs-python

ElevenLabs API 的官方 Python SDK。

3.1K 439
55 whisper-asr-webservice

OpenAI Whisper ASR Web服务 API

3.3K 584
56 fastrtc

用于实时通信的Python库

4.6K 433
57 stt

语音识别转文字工具 / 一个离线运行的本地音视频转字幕工具,输出json、srt字幕、纯文字格式

4.8K 499
58 TTS

:robot: :speech_balloon: 深度学习用于文本转语音 (讨论论坛: https://discourse.mozilla.org/c/tts)

10.2K 1.3K
59 EmotiVoice

EmotiVoice 😊:一个多语音和提示控制的TTS引擎

8.5K 756
60 MeloTTS

高质量的多语言文本转语音库,由MyShell.ai开发。支持英语、西班牙语、法语、中文、日语和韩语。

7.6K 1.1K