#91 · 主分类: 语音合成与识别

sherpa

asr cpp ctc end-to-end-asr python pytorch speech-recognition transducer websocket

语音转文字服务器框架,基于下一代Kaldi

项目最后更新:08/30/26

GitHub Stars

980

Forks数量

149

贡献者数量

58

许可证

Apache-2.0

收录理由

这个项目把预训练好的端到端语音识别模型(transducer 和 CTC 两类)直接变成可用的服务,提供 C++ 和 Python 接口,既能处理离线音频也能应对流式输入。它专门解决推理阶段的工程难题,比如 WebSocket 服务的搭建和端点检测,省去了自己写底层通信的麻烦。项目本身不做训练,配套的模型来自 icefall 这个训练工具,所以使用前需要从那边导出模型。对于做实时字幕、语音助手、通话分析这类音频应用的团队来说,用它快速搭起一个能跑通的识别后端很顺手,不用从头折腾服务器架构和消息传输这些杂活。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目