#20 · 主分类: 语音合成与识别

PaddleSpeech

asr code-switch conformer kws punctuation-restoration self-supervised-learning sound-classification speech-alignment speech-recognition speech-synthesis speech-translation streaming-asr streaming-tts transformer tts vocoder voice-cloning voice-recognition wav2vec2 whisper

易于使用的语音工具包,包括自监督学习模型、带标点的SOTA/流式ASR、带文本前端的流式TTS、说话人验证系统、端到端语音翻译和关键词识别。荣获NAACL2022最佳演示奖。

项目最后更新:08/12/26

GitHub Stars

12.7K

Forks数量

2.0K

贡献者数量

163

许可证

Apache-2.0

收录理由

PaddleSpeech把语音识别、语音合成、说话人验证、关键词唤醒和语音翻译等多类任务整合进同一套基于PaddlePaddle的代码库中,团队如果要做实际产品而不是只评测单个模型,流式ASR和流式TTS服务是比较能落地的部分,基于规则的汉语文本前端能处理文本归一化和字素到音素转换,省去不少调参麻烦。多语言和中英混说场景有LibriSpeech、AIShell、CSMSC等现成数据集配方,后来还集成了Whisper和WavLM用于识别。仓库里提供了字幕生成、移动端TTS和ARM Linux部署的示例,从实验到跑通服务距离更短。NAACL2022最佳演示奖也说明这套工具在实际使用中经得起考验。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目