#213 · 主分类: 语音合成与识别

neural_sp

asr attention attention-mechanism automatic-speech-recognition ctc language-model language-modeling pytorch rnn-transducer seq2seq sequence-to-sequence speech speech-recognition streaming transformer transformer-xl

基于PyTorch的端到端ASR/LM实现

项目最后更新:08/30/21

GitHub Stars

595

Forks数量

132

贡献者数量

10

许可证

Apache-2.0

收录理由

做语音识别研究的人,常常要在不同模型结构之间来回比较,而 neural_sp 把这条链路完整地收在了一个 PyTorch 项目里。从 SpecAugment 这类前端特征处理,到 RNN、Transformer、Conformer 多种编码器,再到 CTC、RNN-T 和注意力解码器,想对比哪种组合更合适,不必再东拼西凑几个库。流式识别是它做得比较扎实的地方,单调注意力、MoChA、延迟可控的变体都有实现,如果你的目标是低延迟场景而不是离线批量解码,这些代码能省不少事。仓库里还带了 LibriSpeech、WSJ、Switchboard、AISHELL 等常见语料的训练脚本,并给出了可复现的词错误率和字错误率作为基线。整体更像一个紧凑的实验台,适合用来判断下一个项目该选哪种编码器或解码器,而不是开箱即用的生产服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目