#204 · 主分类: 语音合成与识别

Speech-Backbones

speech-processing speech-recognition speech-synthesis

这是华为诺亚方舟实验室开源语音技术的主仓库。

项目最后更新:09/18/23

GitHub Stars

601

Forks数量

132

贡献者数量

4

许可证

Other

收录理由

华为诺亚方舟实验室把三篇论文的官方代码集中放在这个仓库里,省去到处找实现的麻烦。Grad-TTS 用扩散概率建模做语音合成,通过逐步去噪生成 mel 谱图,想深入理解概率式 TTS 的读者可以拿它当参考。SPIRAL 则从无标注音频里自监督学习表征,不需要人工标签,适合想从原始录音出发搭建识别或理解系统的场景。DiffVC 把扩散思路用到声音转换上,配合快速最大似然采样,做音色迁移实验时是个不错的起点。每个子项目都附了论文链接和代码,既能当学习资料,也能直接改造成自己的合成、预训练或转换流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目