#130 · 主分类: 语音合成与识别

MASR

asr conformer deep-learning deepspeech pytorch speech speech-recognition speech-to-text squeezeformer

Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。

项目最后更新:07/06/26

GitHub Stars

727

Forks数量

115

贡献者数量

3

许可证

Apache-2.0

收录理由

MASR是一套基于PyTorch的语音转文字框架,同时支持流式与非流式识别,既能应对实时字幕这类低延迟场景,也能处理离线转写任务。它把Conformer、Squeezeformer、DeepSpeech2等主流模型统一在配置驱动的接口后面,切换模型或解码器时无需改动业务代码,工程上省去不少重复劳动。项目提供了覆盖普通话、粤语、英语以及中英混合数据的预训练权重,拿到手就能跑出可用基线,再针对自己的音频做微调即可。此外还集成了多种数据增强、说话人分离推理和网页演示,小团队可以快速搭起一套完整的ASR服务,不必东拼西凑各种组件。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目