#115 · 主分类: 语音合成与识别

TheWhisper

apple-silicon coreml mlx nvidia-gpu on-device-ai real-time speech-recognition speech-to-text streaming transcription translation voice voice-ai

面向流式传输和本地设备优化的 Whisper 模型

项目最后更新:06/15/26

GitHub Stars

897

Forks数量

55

贡献者数量

5

许可证

MIT

收录理由

TheWhisper 把 OpenAI 的 Whisper 模型重新打包成面向流式和设备端推理的引擎,实际用起来差别很快就能感受到。原版 Whisper 固定按 30 秒一段处理,这个项目允许调整分块大小,实时字幕、会议记录或语音界面可以在音频到达时逐步输出文字,延迟和准确率之间的取舍由你自己把握。它针对 NVIDIA GPU 和苹果芯片(通过 CoreML)提供了专门的推理后端,README 里报告在 L40 上跑 whisper-large-v3 大约每秒 220 个 tokens。项目还附带本地 REST API 和一个 Electron 演示应用,让你不用额外搭一套服务端就能从模型走到可用的原型。如果你正在考虑在已有硬件上做自托管或完全离线的转录,看看它能帮你直观了解预期的延迟和功耗。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目