#215 · 主分类: 语音合成与识别

FastASR

speech-recognition

这是一个用C++实现ASR推理的项目,它依赖很少,安装也很简单,推理速度很快,在树莓派4B等ARM平台也可以流畅的运行。 支持的模型是由Google的Transformer模型中优化而来,数据集是开源wenetspeech(10000+小时)或阿里私有数据集(60000+小时), 所以识别效果也很好,可以媲美许多商用的ASR软件。

项目最后更新:03/19/23

GitHub Stars

555

Forks数量

79

贡献者数量

6

许可证

Apache-2.0

收录理由

FastASR 是一个用纯 C++ 写成的语音识别推理引擎,刻意把运行时依赖压到极简:只依赖 FFTW 和 OpenBLAS 两个第三方库,不碰 PyTorch、Paddle、TensorFlow 这类重型框架。这一点在树莓派 4B 这样的 ARM 设备上尤其关键,因为完整深度学习框架装起来麻烦,跑实时推理又太慢。项目内置四个模型,三个非流式、一个流式,涵盖 Paraformer 和 Conformer 等变体,训练数据来自 WenetSpeech 和阿里私有语料,中文及中英混合的识别效果经得起比较。对外提供 C++ 静态库和可 pip 安装的 Python 模块,同时借助 VAD 技术让非流式模型也能处理长语音。对想在嵌入式或边缘设备上做语音交互的团队来说,这种小体积和面向 CPU 的优化正是最吸引人的地方。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目