#175 · 主分类: 语音合成与识别
voicebox-pytorch
artificial-intelligence
deep-learning
text-to-speech
Voicebox的PyTorch实现,MetaAI的新SOTA文本转语音网络
项目最后更新:10/01/24
GitHub Stars
703
Forks数量
59
贡献者数量
7
许可证
MIT
收录理由
Voicebox 是 Meta 提出的流匹配文本转语音模型,其亮点在于把上下文学习引入语音生成。这个仓库用 PyTorch 重新实现了它,代码把整个流程串了起来:从文本到语义模块,经过基于 EnCodec 的音频编解码器,再到条件流匹配封装,因此你可以直接在原始音频上训练,并让模型依据文本和参考片段生成语音。它还支持 Spear-TTS 条件控制,作者反馈实际训练收敛效果不错。需要坦诚说明的是,维护者现在建议改用 E2 TTS 作为更新方案,所以这个项目更适合作为研究 Voicebox 原理和做实验的可靠参考,而不是直接用于生产环境。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。