#108 · 主分类: 语音合成与识别

Whisper-Finetune

android asr chinese ctranslate2 huggingface lora pytorch speech-recognition transformers web whisper

微调Whisper语音识别模型,支持无时间戳数据训练、带时间戳数据训练及无语音数据训练。加速推理,支持Web部署、Windows桌面部署及Android部署。

项目最后更新:05/08/26

GitHub Stars

1.2K

Forks数量

223

贡献者数量

4

许可证

Apache-2.0

收录理由

当OpenAI官方的Whisper模型在特定领域上表现不够理想时,Whisper-Finetune提供了一条完整的微调与部署路径。它把数据准备、LoRA微调、模型合并、CER评估以及CTranslate2/GGML格式转换整合在一起,支持从tiny到large-v3-turbo的多种规模。最实用的地方在于数据灵活性:既能用带时间戳的音频训练,也能用不带时间戳的音频,甚至在没有音频、只有文本的情况下也能训练,这让处理不规整的数据集或纯文本资源成为可能。项目没有止步于训练环节,还提供了服务器端API、Windows桌面程序和安卓端示例,让调优后的模型能真正跑起来,而不是只停留在实验脚本里。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目