#21 · 主分类: 语音合成与识别
voice-pro
面向创作者和开发者的Gradio WebUI,支持关键TTS(Edge-TTS、kokoro)和零样本语音克隆(E2 & F5-TTS、CosyVoice),集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
项目最后更新:07/13/26
GitHub Stars
12.7K
Forks数量
1.8K
贡献者数量
1
许可证
GPL-3.0
收录理由
Voice-Pro 把一整条视频处理流水线收进了一个 Gradio 界面里:丢给它一个视频链接,就能得到转写、翻译和重新配音的成品,不用再自己拼装各种工具。转写基于 Whisper,带词级时间戳;翻译覆盖上百种语言;语音合成有 Edge-TTS 和 kokoro 两个后端。零样本声音克隆是它最出彩的地方,F5-TTS、E2-TTS 和 CosyVoice 能根据短短一段样本就合成新说话人的声音,做配音和有声书时省事很多。内置的 Demucs 可以在转写或克隆之前把人声和背景音乐分开,yt-dlp 则直接从 YouTube 抓取音频。在带 NVIDIA GPU 的 Windows 上,安装器会帮你把模型和依赖都配好;开发者也能把其中开源的部分拆出来用到自己的项目里。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。