#143 · 主分类: 语音合成与识别
tacotron
一个TensorFlow实现的谷歌Tacotron语音合成,带有预训练模型(非官方)
项目最后更新:07/06/23
GitHub Stars
3.0K
Forks数量
936
贡献者数量
12
许可证
MIT
收录理由
谷歌在2017年公开Tacotron论文时并未附上源码,这个TensorFlow复现项目因此成为许多人研究原始端到端方案的入口。它绕开了传统上把文本分析与声学建模拆成多个独立环节的做法,直接让模型从(文本,音频)配对中学习,这也是该论文最具影响力的核心思想。仓库自带一个预训练好的模型文件,配套的演示服务器能让你在浏览器里输入一句话,几分钟内就听到合成语音,完全不需要碰训练数据。如果你想自己训练声音,文档里也写了数据预处理流程,比如用LJ Speech数据集,以及如何在TensorBoard里观察训练进度。需要注意的是,它面向的是TensorFlow 1.x和2018年前后的技术水平,更适合作为学习参考,而不是直接塞进现代TTS系统里的组件。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。