#97 · 主分类: 语音合成与识别

StyleTTS2

adversarial-training deep-learning diffusion-models gan latent-diffusion latent-diffusion-models pytorch speaker-adaptation speech-synthesis text-to-speech tts wavlm

StyleTTS 2:通过风格扩散和大型语音语言模型的对抗训练实现人类级文本到语音合成

项目最后更新:08/10/24

GitHub Stars

6.3K

Forks数量

700

贡献者数量

12

许可证

MIT

收录理由

StyleTTS2 生成的语音,在英语母语听众的评测中,自然度被评价为不逊于真人录音,而且它不需要为每个新声音准备参考录音。其核心思路是把说话风格当作一个潜在变量,由扩散模型根据文本本身来塑造,所以输出带有真实韵律,而不是平淡的朗读腔。最实用的地方在于零样本说话人适应:利用预训练的多说话人模型,只需一段很短的样本就能克隆声音,适合做有声书或配音实验。仓库里提供了推理脚本、单说话人和多说话人的训练代码,以及针对新说话人的微调脚本,从下载好的检查点跑到出音频比较快。整体是研究型代码库,提供的是检查点和 Python 脚本,而不是封装好的 API。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目