#119 · 主分类: 语音合成与识别
whisper.api
该项目提供一个支持用户级别访问的API,使用微调和处理过的Whisper ASR模型将语音转录为文本。
项目最后更新:04/28/26
GitHub Stars
914
Forks数量
38
贡献者数量
1
许可证
MIT
收录理由
whisper.api 是一个可自行部署的语音转文字服务,在 REST 与 WebSocket 接口背后运行 whisper.cpp。它复刻了 Deepgram 的 /v1/listen 端点,已经使用 Deepgram 的团队可以把同一套客户端代码指向自建服务器,音频数据完全掌握在自己手里。除了基础转写,项目还支持提示词自定义词汇、音频裁剪(start/duration)、说话人分离,以及 SRT、VTT 字幕导出,常见媒体和会议处理流程都能覆盖。通过 WebSocket 可以实时转录 16kHz PCM 音频流,自带的命令行工具用来生成 API 密钥和管理模型文件,省去自己拼凑访问控制的麻烦。对于想要一个本地部署的转写服务、又希望有完善文档和 Docker 配置的小团队来说,这是个很实在的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。