#34 · 主分类: 语音合成与识别

ASRT_SpeechRecognition

asrt chinese-speech-recognition cnn ctc keras python python3 speech-recognition speech-to-text tensorflow

基于深度学习的中文语音识别系统

项目最后更新:04/10/26

GitHub Stars

8.4K

Forks数量

1.9K

贡献者数量

13

许可证

GPL-3.0

收录理由

这个项目提供了一套完整的中文语音转文字方案,关键是可以自己动手训练模型,而不只是看看演示。系统采用深度卷积网络配合CTC解码,把最长16秒的音频先转成拼音,再借助统计语言模型输出中文文本。仓库里把整个流程都打包好了:有能在THCHS30、AIShell、ST-CMDS等公开数据集上运行的训练脚本,有可以直接下载的预训练模型,还提供了HTTP和gRPC服务端,以及Python、Go、Java和Windows下的客户端SDK。无论是想快速搭一个能用的转录接口,还是想弄明白CNN加CTC这套结构是怎么端到端配合的,都能从中找到抓手。不过要注意,训练阶段需要一块显存大约11GB的NVIDIA显卡;如果只是做推理,用CPU在Linux或Windows上也能跑起来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目