#24 · 主分类: 语音合成与识别
WhisperLiveKit
实时本地语音转文字,支持流式ASR、说话人分离、翻译,以及兼容OpenAI/Deepgram的API。
项目最后更新:08/29/26
GitHub Stars
11.0K
Forks数量
1.1K
贡献者数量
50
许可证
Apache-2.0
收录理由
批式转写往往要等录音全部结束才能出文本,可很多场景等不了——会议发言、直播字幕、现场访谈,都要求文字跟着话音实时冒出来。WhisperLiveKit 就是把这条流式路线打通了:它基于同步语音识别的研究成果,对输入音频做缓冲处理,一边收声一边吐字幕,不必像标准 Whisper 那样非得拿到完整句子才开工。除了实时转写,它还内置了说话人分离和约两百种语言的同传翻译,并且对外提供与 OpenAI、Deepgram 兼容的接口,老客户端改一下服务器地址就能用,不需要重写代码。整套流水线跑在自己机器上,音频不离开本地,也省去按分钟计费的云端 API 开销。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。