#213 · 主分类: 语音合成与识别
neural_sp
基于PyTorch的端到端ASR/LM实现
项目最后更新:08/30/21
GitHub Stars
595
Forks数量
132
贡献者数量
10
许可证
Apache-2.0
收录理由
做语音识别研究的人,常常要在不同模型结构之间来回比较,而 neural_sp 把这条链路完整地收在了一个 PyTorch 项目里。从 SpecAugment 这类前端特征处理,到 RNN、Transformer、Conformer 多种编码器,再到 CTC、RNN-T 和注意力解码器,想对比哪种组合更合适,不必再东拼西凑几个库。流式识别是它做得比较扎实的地方,单调注意力、MoChA、延迟可控的变体都有实现,如果你的目标是低延迟场景而不是离线批量解码,这些代码能省不少事。仓库里还带了 LibriSpeech、WSJ、Switchboard、AISHELL 等常见语料的训练脚本,并给出了可复现的词错误率和字错误率作为基线。整体更像一个紧凑的实验台,适合用来判断下一个项目该选哪种编码器或解码器,而不是开箱即用的生产服务。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。