#139 · 主分类: 语音合成与识别

PPASR

asr chinese conformer deep-learning deepspeech2 paddlepaddle speech speech-recognition speech-to-text squeezeformer streaming-asr

基于PaddlePaddle实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的DeepSpeech2、Conformer、Squeezeformer模型

项目最后更新:12/17/25

GitHub Stars

871

Forks数量

129

贡献者数量

4

许可证

Apache-2.0

收录理由

对于需要中文语音转写能力的团队,PPASR提供了一个扎实且实用的选项。这个基于PaddlePaddle的自动语音识别框架集成了DeepSpeech2、Conformer、Squeezeformer及高效Conformer等多种端到端模型,每个模型都支持流式与非流式两种运行模式,方便你根据实时交互或离线文件场景,自由地权衡延迟和准确率。工具包内置多种解码器,提供fbank和mfcc特征,并带有丰富的数据增强手段,因此完全可以从头训练自己的模型,而不必依赖预训练权重。项目还发布了基于WenetSpeech数据集的预训练模型,并给出了不同解码策略下的字错误率,使你在自己动手训练前就能获得明确的性能基线。部署上,它支持服务器和Nvidia Jetson设备。分词基于sentencepiece,也为中英文混合训练预留了空间。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目