#21 · 主分类: 语音合成与识别

voice-pro

audiobook faster-whisper gradio karaoke podcasts speech-recognition speech-synthesis speech-to-text subtitles text-to-speech transcription translator tts voice-cloning voice-conversion webui whisper whisperx yt-dlp

面向创作者和开发者的Gradio WebUI,支持关键TTS(Edge-TTS、kokoro)和零样本语音克隆(E2 & F5-TTS、CosyVoice),集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

项目最后更新:07/13/26

GitHub Stars

12.7K

Forks数量

1.8K

贡献者数量

1

许可证

GPL-3.0

收录理由

Voice-Pro 把一整条视频处理流水线收进了一个 Gradio 界面里:丢给它一个视频链接,就能得到转写、翻译和重新配音的成品,不用再自己拼装各种工具。转写基于 Whisper,带词级时间戳;翻译覆盖上百种语言;语音合成有 Edge-TTS 和 kokoro 两个后端。零样本声音克隆是它最出彩的地方,F5-TTS、E2-TTS 和 CosyVoice 能根据短短一段样本就合成新说话人的声音,做配音和有声书时省事很多。内置的 Demucs 可以在转写或克隆之前把人声和背景音乐分开,yt-dlp 则直接从 YouTube 抓取音频。在带 NVIDIA GPU 的 Windows 上,安装器会帮你把模型和依赖都配好;开发者也能把其中开源的部分拆出来用到自己的项目里。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目