#43 · 主分类: 语音合成与识别
whisper-diarization
asr
speaker-diarization
speech
speech-recognition
speech-to-text
whisper
基于OpenAI Whisper的自动语音识别与说话人分离
项目最后更新:08/15/26
GitHub Stars
5.6K
Forks数量
503
贡献者数量
13
许可证
BSD-2-Clause
收录理由
录音里有多人说话时,光有转写文本却分不清谁说了什么,价值就大打折扣。这个项目把OpenAI Whisper的语音识别与语音活动检测、说话人嵌入模型串成一条流水线,让输出中的每一句都能对应到具体的声音。它先做声纹分离,把干净的语音交给嵌入模型,最后返回带说话人标签和时间戳的转录,而不是一坨没有区别的文字。做会议纪要工具或检索通话录音的团队,可以直接把它当积木用;项目里还附了Colab笔记本,拿自己的音频先跑一遍,上手很轻松。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。