#67 · 主分类: 语音合成与识别
whisper-timestamped
asr
attention-is-all-you-need
attention-mechanism
attention-model
attention-network
attention-seq2seq
attention-visualization
deep-learning
machine-learning
multilingual-models
python
python3
pytorch
speaker-diarization
speech
speech-processing
speech-recognition
speech-to-text
transformers
whisper
多语言自动语音识别,具有词级时间戳和置信度
项目最后更新:08/17/26
GitHub Stars
2.8K
Forks数量
211
贡献者数量
11
许可证
AGPL-3.0
收录理由
做字幕、会议纪要或可检索音频库的人,很快会遇到原生Whisper的一个坎:它只按片段给出时间戳,通常精确到一秒左右,可当每个词都需要确切位置时,这个粒度太粗了。这个项目用动态时间规整把Whisper的交叉注意力权重对齐起来,算出每个词的起止时间,并给每个词和每个片段附上置信度分数,下游要过滤时就有实打实的依据。对齐是在解码每个片段的同时完成的,不用另跑一遍,而且无论是Python调用还是命令行,都能直接嵌进openai-whisper包里。项目还提供语音活动检测来抑制Whisper在静音时产生的幻觉,并且在没有指定语言时会给出语言置信度,这两个特性对无人值守的大批量音频处理很有帮助。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。