#144 · 主分类: 语音合成与识别

Automatic_Speech_Recognition

audio automatic-speech-recognition chinese-speech-recognition cnn data-preprocessing deep-learning end-to-end evaluation feature-vector layer-normalization lstm paper phonemes rnn rnn-encoder-decoder speech-recognition tensorflow timit-dataset

基于Tensorflow的端到端中英文自动语音识别

项目最后更新:03/24/23

GitHub Stars

2.8K

Forks数量

535

贡献者数量

11

许可证

MIT

收录理由

这个项目用 TensorFlow 实现了一套紧凑的端到端语音识别系统,代码组织得很清楚,适合研究人员和学生用来理解完整 ASR 流水线是怎么搭起来的。它覆盖了从 Timit、LibriSpeech、WSJ 以及中文语料的特征提取,到带注意力机制的序列到序列 RNN 编码器,还包含可用的 DeepSpeech2 和层归一化 RNN 变体。由于同时支持英文和中文,并且自带数据预处理工具,想从原始音频开始训练识别器的人,可以拿它当很好的学习起点,而不是把各种云端的黑盒 API 拼在一起。代码偏老,绑定了特定版本的 TensorFlow,所以更适合作为教学蓝图和基准测试,而不是直接用于生产环境。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目