#113 · 主分类: 语音合成与识别

distil-whisper

audio speech-recognition whisper

用于语音识别的 Whisper 蒸馏变体。速度快 6 倍,体积小 50%,词错误率在 1% 以内。

项目最后更新:01/08/25

GitHub Stars

4.1K

Forks数量

357

贡献者数量

11

许可证

MIT

收录理由

Distil-Whisper 直击 OpenAI Whisper 最常被诟病的痛点:模型太重、推理太慢,难以支撑大规模或实时转写。蒸馏后的检查点在分布外数据集上,词错误率与 Whisper large-v3 仅差约 1%,但运行速度快了约六倍,模型体积也缩小一半,性能提升是实打实的,不是纸面数字。使用时走 Hugging Face Transformers 标准的自动语音识别流程,跟用原版模型没有区别,README 里也给出了短视频片段、本地音频文件、时间戳和 beam search 的完整示例。如果内存吃紧,distil-small.en 变体把参数量压到 1.66 亿,精度损失不大,很适合端侧或移动场景。需要留意的是,这些检查点只支持英文,做多语种识别的团队还是得看 Whisper Turbo。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目