#67 · 主分类: 语音合成与识别

whisper-timestamped

asr attention-is-all-you-need attention-mechanism attention-model attention-network attention-seq2seq attention-visualization deep-learning machine-learning multilingual-models python python3 pytorch speaker-diarization speech speech-processing speech-recognition speech-to-text transformers whisper

多语言自动语音识别,具有词级时间戳和置信度

项目最后更新:08/17/26

GitHub Stars

2.8K

Forks数量

211

贡献者数量

11

许可证

AGPL-3.0

收录理由

做字幕、会议纪要或可检索音频库的人,很快会遇到原生Whisper的一个坎:它只按片段给出时间戳,通常精确到一秒左右,可当每个词都需要确切位置时,这个粒度太粗了。这个项目用动态时间规整把Whisper的交叉注意力权重对齐起来,算出每个词的起止时间,并给每个词和每个片段附上置信度分数,下游要过滤时就有实打实的依据。对齐是在解码每个片段的同时完成的,不用另跑一遍,而且无论是Python调用还是命令行,都能直接嵌进openai-whisper包里。项目还提供语音活动检测来抑制Whisper在静音时产生的幻觉,并且在没有指定语言时会给出语言置信度,这两个特性对无人值守的大批量音频处理很有帮助。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目