#193 · 主分类: 语音合成与识别
WhisperS2T
为Whisper模型优化的语音转文本流水线,支持多种推理引擎
项目最后更新:08/27/24
GitHub Stars
577
Forks数量
75
贡献者数量
3
许可证
MIT
收录理由
WhisperS2T 是一个围绕 OpenAI Whisper 打造的实用工具,核心价值在于让你能自由切换多种推理后端——原版实现、带 FlashAttention 2 的 HuggingFace、CTranslate2 以及 TensorRT-LLM,从而根据手头硬件和延迟要求选择最合适的引擎。它并不只是简单调用模型:能把短语音片段跨文件批量处理,在转录的同时异步加载大音频,还引入了一些启发式规则来抑制 Whisper 常见的重复文本幻觉。词级时间戳对齐和语音活动检测都是内置的,转录结果可以导出为 SRT、VTT 等常见格式,做字幕和会议纪要都很顺手。如果你已经在用 WhisperX 或 faster-whisper,这套 API 会让你感到熟悉,而它相对这些工具宣称的加速效果,也值得你在自己的音频上先跑一遍基准测试再决定是否切换。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。