#139 · 主分类: 语音合成与识别

SpeechT5

speech-pretraining speech-recognition speech-synthesis speech-text-pretraining speech-translation speech2c speechlm speecht5 speechut vallex vatlm

统一模态语音-文本预训练用于口语处理

项目最后更新:04/24/24

GitHub Stars

1.4K

Forks数量

135

贡献者数量

9

许可证

MIT

收录理由

Microsoft 的 SpeechT5 仓库展现了一个统一的语音-文本预训练思路如何生长为一大族模型。核心的 SpeechT5 编码器-解码器同时从语音和文本中学习,代码库中还实现了端到端语音识别、语音到语音转换、语音翻译、文本到语音,以及像 WavLLM 这样的语音语言模型。每个模型都放在独立文件夹中,附有训练和推理脚本,你可以据此复现论文结果,或把配方改到自己的数据上。如果你想研究现代语音模型是怎么搭起来的,而不是只找一个现成的识别器来用,这个仓库是很实在的参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目