#34 · 主分类: 语音合成与识别
ASRT_SpeechRecognition
基于深度学习的中文语音识别系统
项目最后更新:04/10/26
GitHub Stars
8.4K
Forks数量
1.9K
贡献者数量
13
许可证
GPL-3.0
收录理由
这个项目提供了一套完整的中文语音转文字方案,关键是可以自己动手训练模型,而不只是看看演示。系统采用深度卷积网络配合CTC解码,把最长16秒的音频先转成拼音,再借助统计语言模型输出中文文本。仓库里把整个流程都打包好了:有能在THCHS30、AIShell、ST-CMDS等公开数据集上运行的训练脚本,有可以直接下载的预训练模型,还提供了HTTP和gRPC服务端,以及Python、Go、Java和Windows下的客户端SDK。无论是想快速搭一个能用的转录接口,还是想弄明白CNN加CTC这套结构是怎么端到端配合的,都能从中找到抓手。不过要注意,训练阶段需要一块显存大约11GB的NVIDIA显卡;如果只是做推理,用CPU在Linux或Windows上也能跑起来。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。