#130 · 主分类: 语音合成与识别

audio-webui

ai aio all-in-one artificial-intelligence audiocraft audioldm bark bark-gui generative-audio generative-music music rvc rvc-gui text-to-audio text-to-speech tts voice-cloning

用于不同音频相关神经网络的Web界面

项目最后更新:05/19/25

GitHub Stars

1.2K

Forks数量

113

贡献者数量

10

许可证

MIT

收录理由

这个项目把多种音频相关的神经网络模型整合到一个浏览器界面里,让你不用分别搭建每个模型的代码仓库,就能在文本转语音、声音克隆和声音转换之间切换操作。它支持Bark、RVC、AudioCraft等模型,可以基于文字生成语音、用一小段样本克隆音色,或者把一种声音转换成另一种。界面基于Gradio构建,在本地运行,通过浏览器打开网页使用,同时提供了自动安装脚本和Docker选项,方便容器化部署。对于想尝试生成式音频的爱好者或小团队来说,这是个不错的起点;如果你希望有一个自托管的方案来替代云端TTS服务,它也很合适。不过要注意,它面向Python 3.10,并且需要安装ffmpeg和Git,并不是零依赖的工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目