#178 · 主分类: 语音合成与识别

eesen

asr ctc ctc-loss kaldi speech-recognition speech-to-text tensorflow

Eesen项目的官方仓库

项目最后更新:05/23/19

GitHub Stars

834

Forks数量

338

贡献者数量

20

许可证

Apache-2.0

收录理由

Eesen 把语音识别简化成一个直接的序列学习问题,绕开了传统流程里 HMM、GMM 和决策树那套复杂机制。你只需要训练一个双向 LSTM,配合 CTC 损失函数,就能让模型直接从语音映射到文本。它的两种解码路径值得细看:基于 WFST 的解码能高效地把词典和语言模型整合进 CTC 输出,而基于 RNN 语言模型的解码则不需要固定词典。仓库里还带了完整的 Kaldi 风格示例配置,分别用音素和字符作为标签,照着跑就能搭出端到端系统,方便你研究具体实现而不是只看论文。这个项目从 2019 年起就不再更新,更适合当作学习 CTC 语音识别的起点,而不是直接上生产的工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目