#10 · 主分类: 语音合成与识别

whisperX

asr speech speech-recognition speech-to-text whisper

WhisperX: 具有词级时间戳(及说话人分离)的自动语音识别

项目最后更新:07/13/26

GitHub Stars

23.8K

Forks数量

2.4K

贡献者数量

118

许可证

BSD-2-Clause

收录理由

Whisper 能给出转写文本,却缺少字幕和检索工具所依赖的词级时间戳。WhisperX 在 OpenAI 的语音识别模型之上引入强制音素对齐与语音活动检测,让每个词的时间码都能与音频精确对应,同时通过批量推理大幅提升处理速度。这种逐词级别的精度,对字幕生成、会议纪要和媒体检索都很有价值——想直接跳到某句话被说出的那一刻,靠的就是它。项目还借助 pyannote 实现说话人分离,多说话人录音最终会按人标注清楚。命令行工具和 Python 接口让接入现有转写流程变得顺手,开箱即用的对齐模型也覆盖了相当广的语言范围。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目