#146 · 主分类: 语音合成与识别

naturalspeech2-pytorch

artificial-intelligence deep-learning latent-diffusion residual-vector-quantization singing-synthesis speech-synthesis zero-shot

在Pytorch中实现Natural Speech 2,零样本语音和歌声合成器

项目最后更新:09/24/23

GitHub Stars

1.3K

Forks数量

104

贡献者数量

4

许可证

MIT

收录理由

这个仓库用 PyTorch 实现了 Natural Speech 2 论文中的语音合成系统,核心思路是把神经音频编解码器产生的连续潜变量与潜在扩散模型结合起来,实现零样本的语音和歌声生成。装好之后就能直接用,代码里带了扩散模型、EnCodec 封装和训练器,照着 README 里的示例就能跑通训练流程,换自己的音频数据也没问题。零样本合成靠的是语音提示编码器,给一小段参考音频就能让模型模仿音色和风格,另外还加了论文里没有的 classifier-free guidance,效果上更灵活。音素、音高、时长这几个编码器也都齐了,想复现论文结果或者在此基础上改扩散模型做实验,都挺方便。需要提醒的是,项目标注了 work-in-progress,内部实现可能还在调整,直接用进生产环境要谨慎,更适合拿来研究和二次开发。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目