#105 · 主分类: 语音合成与识别
VoiceStreamAI
使用自托管 Whisper 和 WebSocket 在 Python/JS 中实现近实时音频转录
项目最后更新:08/13/26
GitHub Stars
959
Forks数量
140
贡献者数量
3
许可证
MIT
收录理由
VoiceStreamAI 是一套可自行部署的流式语音转写方案,核心思路是让音频通过 WebSocket 持续流入 Python 服务端,经过语音活动检测与基于 Whisper 的识别模块后,近乎实时地回传文本,不必等整段录音播完。它的检测与识别组件采用工厂和策略模式组织,想换用不同的 VAD 模型或转写引擎(默认用 Pyannote 做检测、faster-whisper 做识别),或者调整音频分块缓冲的方式,都不用改动服务主体。附带 JavaScript 客户端负责浏览器端交互,Docker 镜像也让 GPU 环境搭建省了不少事。如果你希望在自己的硬件上做实时字幕、会议纪要或语音控制,又不想依赖商业 API,这套代码值得作为起点参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。