#119 · 主分类: 语音合成与识别

whisper.api

asr innovatorved transcribe whisper

该项目提供一个支持用户级别访问的API,使用微调和处理过的Whisper ASR模型将语音转录为文本。

项目最后更新:04/28/26

GitHub Stars

914

Forks数量

38

贡献者数量

1

许可证

MIT

收录理由

whisper.api 是一个可自行部署的语音转文字服务,在 REST 与 WebSocket 接口背后运行 whisper.cpp。它复刻了 Deepgram 的 /v1/listen 端点,已经使用 Deepgram 的团队可以把同一套客户端代码指向自建服务器,音频数据完全掌握在自己手里。除了基础转写,项目还支持提示词自定义词汇、音频裁剪(start/duration)、说话人分离,以及 SRT、VTT 字幕导出,常见媒体和会议处理流程都能覆盖。通过 WebSocket 可以实时转录 16kHz PCM 音频流,自带的命令行工具用来生成 API 密钥和管理模型文件,省去自己拼凑访问控制的麻烦。对于想要一个本地部署的转写服务、又希望有完善文档和 Docker 配置的小团队来说,这是个很实在的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目