#10 · 主分类: 语音合成与识别
whisperX
asr
speech
speech-recognition
speech-to-text
whisper
WhisperX: 具有词级时间戳(及说话人分离)的自动语音识别
项目最后更新:07/13/26
GitHub Stars
23.8K
Forks数量
2.4K
贡献者数量
118
许可证
BSD-2-Clause
收录理由
Whisper 能给出转写文本,却缺少字幕和检索工具所依赖的词级时间戳。WhisperX 在 OpenAI 的语音识别模型之上引入强制音素对齐与语音活动检测,让每个词的时间码都能与音频精确对应,同时通过批量推理大幅提升处理速度。这种逐词级别的精度,对字幕生成、会议纪要和媒体检索都很有价值——想直接跳到某句话被说出的那一刻,靠的就是它。项目还借助 pyannote 实现说话人分离,多说话人录音最终会按人标注清楚。命令行工具和 Python 接口让接入现有转写流程变得顺手,开箱即用的对齐模型也覆盖了相当广的语言范围。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。