#20 · 主分类: 语音合成与识别
PaddleSpeech
易于使用的语音工具包,包括自监督学习模型、带标点的SOTA/流式ASR、带文本前端的流式TTS、说话人验证系统、端到端语音翻译和关键词识别。荣获NAACL2022最佳演示奖。
项目最后更新:08/12/26
GitHub Stars
12.7K
Forks数量
2.0K
贡献者数量
163
许可证
Apache-2.0
收录理由
PaddleSpeech把语音识别、语音合成、说话人验证、关键词唤醒和语音翻译等多类任务整合进同一套基于PaddlePaddle的代码库中,团队如果要做实际产品而不是只评测单个模型,流式ASR和流式TTS服务是比较能落地的部分,基于规则的汉语文本前端能处理文本归一化和字素到音素转换,省去不少调参麻烦。多语言和中英混说场景有LibriSpeech、AIShell、CSMSC等现成数据集配方,后来还集成了Whisper和WavLM用于识别。仓库里提供了字幕生成、移动端TTS和ARM Linux部署的示例,从实验到跑通服务距离更短。NAACL2022最佳演示奖也说明这套工具在实际使用中经得起考验。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。