#191 · 主分类: 语音合成与识别

speech-to-text

faster-whisper openai speech-recognition speech-to-text voice-recognition whisper

使用 faster-whisper 的实时转录

项目最后更新:07/23/24

GitHub Stars

614

Forks数量

99

贡献者数量

1

许可证

MIT

收录理由

这款桌面工具把麦克风输入实时转成文字,核心用 faster-whisper 做识别,配合 Silero VAD 检测语音活动,把连续说话切分成独立片段再逐段转写。在 RTX 3060 这类中端显卡上,句子间隔清晰时,一次转写通常不到一秒。它自带浏览器界面,模型大小、VAD 阈值、转写参数都能直接调整,不用改代码。除了麦克风,也支持 wav、mp3、ogg 等音频文件,能导出 SRT 字幕,还能通过 WebSocket 把结果推给客户端,适合做直播字幕。如果接上 OpenAI API,还能对转写文本做校对。无论是整理会议记录、给直播加字幕,还是做辅助功能,它把底层流程都处理好了,你只需要在此基础上做自己的应用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目