#115 · 主分类: 语音合成与识别
TheWhisper
面向流式传输和本地设备优化的 Whisper 模型
项目最后更新:06/15/26
GitHub Stars
897
Forks数量
55
贡献者数量
5
许可证
MIT
收录理由
TheWhisper 把 OpenAI 的 Whisper 模型重新打包成面向流式和设备端推理的引擎,实际用起来差别很快就能感受到。原版 Whisper 固定按 30 秒一段处理,这个项目允许调整分块大小,实时字幕、会议记录或语音界面可以在音频到达时逐步输出文字,延迟和准确率之间的取舍由你自己把握。它针对 NVIDIA GPU 和苹果芯片(通过 CoreML)提供了专门的推理后端,README 里报告在 L40 上跑 whisper-large-v3 大约每秒 220 个 tokens。项目还附带本地 REST API 和一个 Electron 演示应用,让你不用额外搭一套服务端就能从模型走到可用的原型。如果你正在考虑在已有硬件上做自托管或完全离线的转录,看看它能帮你直观了解预期的延迟和功耗。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。