#24 · 主分类: 语音合成与识别

WhisperLiveKit

automatic-speech-recognition fastapi python pytorch real-time speaker-diarization speech-recognition speech-to-text streaming translation websocket whisper

实时本地语音转文字,支持流式ASR、说话人分离、翻译,以及兼容OpenAI/Deepgram的API。

项目最后更新:08/29/26

GitHub Stars

11.0K

Forks数量

1.1K

贡献者数量

50

许可证

Apache-2.0

收录理由

批式转写往往要等录音全部结束才能出文本,可很多场景等不了——会议发言、直播字幕、现场访谈,都要求文字跟着话音实时冒出来。WhisperLiveKit 就是把这条流式路线打通了:它基于同步语音识别的研究成果,对输入音频做缓冲处理,一边收声一边吐字幕,不必像标准 Whisper 那样非得拿到完整句子才开工。除了实时转写,它还内置了说话人分离和约两百种语言的同传翻译,并且对外提供与 OpenAI、Deepgram 兼容的接口,老客户端改一下服务器地址就能用,不需要重写代码。整套流水线跑在自己机器上,音频不离开本地,也省去按分钟计费的云端 API 开销。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目