#139 · 主分类: 语音合成与识别
SpeechT5
speech-pretraining
speech-recognition
speech-synthesis
speech-text-pretraining
speech-translation
speech2c
speechlm
speecht5
speechut
vallex
vatlm
统一模态语音-文本预训练用于口语处理
项目最后更新:04/24/24
GitHub Stars
1.4K
Forks数量
135
贡献者数量
9
许可证
MIT
收录理由
Microsoft 的 SpeechT5 仓库展现了一个统一的语音-文本预训练思路如何生长为一大族模型。核心的 SpeechT5 编码器-解码器同时从语音和文本中学习,代码库中还实现了端到端语音识别、语音到语音转换、语音翻译、文本到语音,以及像 WavLLM 这样的语音语言模型。每个模型都放在独立文件夹中,附有训练和推理脚本,你可以据此复现论文结果,或把配方改到自己的数据上。如果你想研究现代语音模型是怎么搭起来的,而不是只找一个现成的识别器来用,这个仓库是很实在的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。