#144 · 主分类: 语音合成与识别
Automatic_Speech_Recognition
audio
automatic-speech-recognition
chinese-speech-recognition
cnn
data-preprocessing
deep-learning
end-to-end
evaluation
feature-vector
layer-normalization
lstm
paper
phonemes
rnn
rnn-encoder-decoder
speech-recognition
tensorflow
timit-dataset
基于Tensorflow的端到端中英文自动语音识别
项目最后更新:03/24/23
GitHub Stars
2.8K
Forks数量
535
贡献者数量
11
许可证
MIT
收录理由
这个项目用 TensorFlow 实现了一套紧凑的端到端语音识别系统,代码组织得很清楚,适合研究人员和学生用来理解完整 ASR 流水线是怎么搭起来的。它覆盖了从 Timit、LibriSpeech、WSJ 以及中文语料的特征提取,到带注意力机制的序列到序列 RNN 编码器,还包含可用的 DeepSpeech2 和层归一化 RNN 变体。由于同时支持英文和中文,并且自带数据预处理工具,想从原始音频开始训练识别器的人,可以拿它当很好的学习起点,而不是把各种云端的黑盒 API 拼在一起。代码偏老,绑定了特定版本的 TensorFlow,所以更适合作为教学蓝图和基准测试,而不是直接用于生产环境。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。