#135 · 主分类: 语音合成与识别
masr
中文语音识别;普通话自动语音识别
项目最后更新:07/25/24
GitHub Stars
2.0K
Forks数量
477
贡献者数量
1
许可证
Other
收录理由
MASR 是一个端到端的中文普通话语音识别项目,核心网络采用门控卷积结构,思路接近 Facebook 2016 年的 Wav2letter,但激活函数换成了 GLU 而非 ReLU 或 HardTanh。作者在 AISHELL-1 语料上训练,并给出了字错误率(CER)的实测数据:测试集 CER 约为 14%,外接语言模型后可降到 8%。仓库自带接近最优效果的预训练权重,想直接体验的话不必从头训练。更难得的是,README 对项目局限说得非常坦白——150 小时的录音量远小于商业系统常用的数据规模,因此别指望它和工业级产品比肩。对于想研究卷积声学模型的人,或者单纯好奇一个单人维护的中文识别项目能做到什么程度,这份代码和说明都是清晰可读的参考,而不是拿来即用的生产工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。