#178 · 主分类: 语音合成与识别
eesen
asr
ctc
ctc-loss
kaldi
speech-recognition
speech-to-text
tensorflow
Eesen项目的官方仓库
项目最后更新:05/23/19
GitHub Stars
834
Forks数量
338
贡献者数量
20
许可证
Apache-2.0
收录理由
Eesen 把语音识别简化成一个直接的序列学习问题,绕开了传统流程里 HMM、GMM 和决策树那套复杂机制。你只需要训练一个双向 LSTM,配合 CTC 损失函数,就能让模型直接从语音映射到文本。它的两种解码路径值得细看:基于 WFST 的解码能高效地把词典和语言模型整合进 CTC 输出,而基于 RNN 语言模型的解码则不需要固定词典。仓库里还带了完整的 Kaldi 风格示例配置,分别用音素和字符作为标签,照着跑就能搭出端到端系统,方便你研究具体实现而不是只看论文。这个项目从 2019 年起就不再更新,更适合当作学习 CTC 语音识别的起点,而不是直接上生产的工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。