#7 · 主分类: 语音合成与识别
MockingBird
ai
deep-learning
pytorch
speech
text-to-speech
tts
🚀在5秒内克隆声音,实时生成任意语音
项目最后更新:03/03/26
GitHub Stars
36.9K
Forks数量
5.2K
贡献者数量
41
许可证
Other
收录理由
MockingBird 能从一段很短的语音样本里克隆出说话人的音色,然后用这个音色实时合成任意内容,至今仍是这类开源项目里被引用最多的起点之一。它沿用了 Real-Time Voice Cloning 的流程,直接复用预训练好的编码器和声码器,只需要自己训练合成器部分,比起从零搭建整套 TTS 要轻量不少。对中文的支持是它的一个突出亮点,作者用多个中文数据集做过测试,同时提供了桌面工具箱方便交互实验,也内置了 Web 服务支持远程调用。需要坦诚说明的是,作者已经不再积极维护这个仓库,转而推荐一个云托管的新版本,所以更适合把它当作一份扎实的参考实现和学习材料,如果要在生产环境里依赖它,得提前想好后续的维护方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。