#125 · 主分类: 语音合成与识别
espresso
asr
end-to-end
fairseq
kaldi
python
pytorch
speech-recognition
Espresso:一个快速的端到端神经语音识别工具包
项目最后更新:09/04/24
GitHub Stars
939
Forks数量
116
贡献者数量
424
许可证
MIT
收录理由
Espresso为语音研究者与工程师提供了一套开箱即用的端到端语音识别方案,省去自行拼装各组件的麻烦。它以PyTorch为基础,沿用fairseq的项目惯例,通过YAML配置文件管理实验,支持跨GPU与多节点的分布式训练。解码端提供CTC、Transducer(RNN-T)以及基于快速并行实现的前瞻词级语言模型融合等多种选择。内置WSJ、LibriSpeech、Switchboard三个数据集的训练脚本,便于快速上手;若希望简化流程,还可选用基于torchaudio的在线特征提取,不再依赖Kaldi。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。