#43 · 主分类: 语音合成与识别

whisper-diarization

asr speaker-diarization speech speech-recognition speech-to-text whisper

基于OpenAI Whisper的自动语音识别与说话人分离

项目最后更新:08/15/26

GitHub Stars

5.6K

Forks数量

503

贡献者数量

13

许可证

BSD-2-Clause

收录理由

录音里有多人说话时,光有转写文本却分不清谁说了什么,价值就大打折扣。这个项目把OpenAI Whisper的语音识别与语音活动检测、说话人嵌入模型串成一条流水线,让输出中的每一句都能对应到具体的声音。它先做声纹分离,把干净的语音交给嵌入模型,最后返回带说话人标签和时间戳的转录,而不是一坨没有区别的文字。做会议纪要工具或检索通话录音的团队,可以直接把它当积木用;项目里还附了Colab笔记本,拿自己的音频先跑一遍,上手很轻松。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目