#138 · 主分类: 语音合成与识别

kaldi-gstreamer-server

speech-recognition

基于Kaldi工具包和GStreamer框架的实时全双工语音识别服务器。

项目最后更新:06/08/24

GitHub Stars

1.1K

Forks数量

338

贡献者数量

22

许可证

BSD-2-Clause

收录理由

多数Kaldi项目止步于离线批量解码,而这个服务器解决的是更棘手的实时识别难题——通过websocket接收音频,在说话人还在开口时就把部分识别结果流式返回,正是语音输入法和实时字幕背后的交互逻辑。它采用主从架构,协调逻辑与解码进程分离,工作节点可以部署在远程机器上,随并发会话增加灵活扩展。基于静音切分处理长语音流,还能用大语言模型对识别网格重打分以提升精度。不过,你需要自己编译Kaldi及其GStreamer插件,并接受Python 2时代的依赖环境,因此更适合已经熟悉Kaldi工具链的团队。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目