#191 · 主分类: 语音合成与识别
speech-to-text
faster-whisper
openai
speech-recognition
speech-to-text
voice-recognition
whisper
使用 faster-whisper 的实时转录
项目最后更新:07/23/24
GitHub Stars
614
Forks数量
99
贡献者数量
1
许可证
MIT
收录理由
这款桌面工具把麦克风输入实时转成文字,核心用 faster-whisper 做识别,配合 Silero VAD 检测语音活动,把连续说话切分成独立片段再逐段转写。在 RTX 3060 这类中端显卡上,句子间隔清晰时,一次转写通常不到一秒。它自带浏览器界面,模型大小、VAD 阈值、转写参数都能直接调整,不用改代码。除了麦克风,也支持 wav、mp3、ogg 等音频文件,能导出 SRT 字幕,还能通过 WebSocket 把结果推给客户端,适合做直播字幕。如果接上 OpenAI API,还能对转写文本做校对。无论是整理会议记录、给直播加字幕,还是做辅助功能,它把底层流程都处理好了,你只需要在此基础上做自己的应用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。