#135 · 主分类: 语音合成与识别

masr

chinese-speech-recognition mandarin-chinese pytorch speech-recognition

中文语音识别;普通话自动语音识别

项目最后更新:07/25/24

GitHub Stars

2.0K

Forks数量

477

贡献者数量

1

许可证

Other

收录理由

MASR 是一个端到端的中文普通话语音识别项目,核心网络采用门控卷积结构,思路接近 Facebook 2016 年的 Wav2letter,但激活函数换成了 GLU 而非 ReLU 或 HardTanh。作者在 AISHELL-1 语料上训练,并给出了字错误率(CER)的实测数据:测试集 CER 约为 14%,外接语言模型后可降到 8%。仓库自带接近最优效果的预训练权重,想直接体验的话不必从头训练。更难得的是,README 对项目局限说得非常坦白——150 小时的录音量远小于商业系统常用的数据规模,因此别指望它和工业级产品比肩。对于想研究卷积声学模型的人,或者单纯好奇一个单人维护的中文识别项目能做到什么程度,这份代码和说明都是清晰可读的参考,而不是拿来即用的生产工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目