#202 · 主分类: 语音合成与识别
kospeech
基于PyTorch和Hydra的端到端韩语自动语音识别开源工具包。
项目最后更新:05/27/23
GitHub Stars
636
Forks数量
189
贡献者数量
11
许可证
Apache-2.0
收录理由
KoSpeech 是少数专门围绕韩语端到端语音识别构建的开源工具包之一,在它出现的那个时期,大多数语音识别库都以英语为对象,因此它填补了一个实实在在的空白。项目提供了主流声学模型家族的参考实现,包括 Deep Speech 2、Listen Attend and Spell、RNN-Transducer、Speech Transformer、Jasper 和 Conformer,还附带 KsponSpeech 语料库的预处理流程。对于想学习这些架构如何在 PyTorch 中组装起来的人,这是一份很有用的学习材料。研究人员和学生如果希望在韩语音频上比较不同模型结构,或者想追踪 CTC 与基于注意力的解码器是如何实现的,会发现这份代码可读性强、文档也写得清楚。需要留意的是,该项目已经归档,维护者建议把 OpenSpeech 用于实际的训练工作,所以更适合把 KoSpeech 当作参考和学习资源,而不是新生产流程所依赖的组件。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。