#91 · 主分类: 语音合成与识别
sherpa
asr
cpp
ctc
end-to-end-asr
python
pytorch
speech-recognition
transducer
websocket
语音转文字服务器框架,基于下一代Kaldi
项目最后更新:08/30/26
GitHub Stars
980
Forks数量
149
贡献者数量
58
许可证
Apache-2.0
收录理由
这个项目把预训练好的端到端语音识别模型(transducer 和 CTC 两类)直接变成可用的服务,提供 C++ 和 Python 接口,既能处理离线音频也能应对流式输入。它专门解决推理阶段的工程难题,比如 WebSocket 服务的搭建和端点检测,省去了自己写底层通信的麻烦。项目本身不做训练,配套的模型来自 icefall 这个训练工具,所以使用前需要从那边导出模型。对于做实时字幕、语音助手、通话分析这类音频应用的团队来说,用它快速搭起一个能跑通的识别后端很顺手,不用从头折腾服务器架构和消息传输这些杂活。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。