#202 · 主分类: 语音合成与识别

kospeech

asr attention-is-all-you-need conformer e2e-asr end-to-end jasper korean-speech ksponspeech las las-models pytorch seq2seq speech-recognition transformer

基于PyTorch和Hydra的端到端韩语自动语音识别开源工具包。

项目最后更新:05/27/23

GitHub Stars

636

Forks数量

189

贡献者数量

11

许可证

Apache-2.0

收录理由

KoSpeech 是少数专门围绕韩语端到端语音识别构建的开源工具包之一,在它出现的那个时期,大多数语音识别库都以英语为对象,因此它填补了一个实实在在的空白。项目提供了主流声学模型家族的参考实现,包括 Deep Speech 2、Listen Attend and Spell、RNN-Transducer、Speech Transformer、Jasper 和 Conformer,还附带 KsponSpeech 语料库的预处理流程。对于想学习这些架构如何在 PyTorch 中组装起来的人,这是一份很有用的学习材料。研究人员和学生如果希望在韩语音频上比较不同模型结构,或者想追踪 CTC 与基于注意力的解码器是如何实现的,会发现这份代码可读性强、文档也写得清楚。需要留意的是,该项目已经归档,维护者建议把 OpenSpeech 用于实际的训练工作,所以更适合把 KoSpeech 当作参考和学习资源,而不是新生产流程所依赖的组件。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目