#106 · 主分类: 语音合成与识别

vits

deep-learning pytorch speech-synthesis text-to-speech tts

VITS:条件变分自编码器与对抗学习用于端到端文本到语音合成

项目最后更新:12/06/23

GitHub Stars

7.9K

Forks数量

1.4K

贡献者数量

3

许可证

MIT

收录理由

VITS 把完整的文语合成流程压缩进一个模型,省去了传统上把声学模型和声码器分开拼接的繁琐步骤。它基于条件变分自编码器,结合了归一化流和对抗训练,同时引入随机时长预测器,让同一句文本能以不同的音高和节奏被说出来,而不是永远一种腔调。项目作者公开了配套论文、在 LJ Speech 单说话人数据集上预训练好的权重,以及一个可交互的 Colab 演示,你可以在不碰任何配置的情况下先听合成效果。训练和推理脚本同时覆盖单说话人与多说话人(VCTK)场景,既能作为可复现的研究基线,也适合在此基础上适配自己的数据。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目