#108 · 主分类: 语音合成与识别
Whisper-Finetune
微调Whisper语音识别模型,支持无时间戳数据训练、带时间戳数据训练及无语音数据训练。加速推理,支持Web部署、Windows桌面部署及Android部署。
项目最后更新:05/08/26
GitHub Stars
1.2K
Forks数量
223
贡献者数量
4
许可证
Apache-2.0
收录理由
当OpenAI官方的Whisper模型在特定领域上表现不够理想时,Whisper-Finetune提供了一条完整的微调与部署路径。它把数据准备、LoRA微调、模型合并、CER评估以及CTranslate2/GGML格式转换整合在一起,支持从tiny到large-v3-turbo的多种规模。最实用的地方在于数据灵活性:既能用带时间戳的音频训练,也能用不带时间戳的音频,甚至在没有音频、只有文本的情况下也能训练,这让处理不规整的数据集或纯文本资源成为可能。项目没有止步于训练环节,还提供了服务器端API、Windows桌面程序和安卓端示例,让调优后的模型能真正跑起来,而不是只停留在实验脚本里。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。