#55 · 主分类: 语音合成与识别
whisper-asr-webservice
OpenAI Whisper ASR Web服务 API
项目最后更新:08/09/26
GitHub Stars
3.3K
Forks数量
584
贡献者数量
20
许可证
MIT
收录理由
这个项目把OpenAI的Whisper语音识别模型包装成一个简洁的HTTP接口,省去了自己搭建服务层的麻烦。它提供了现成的Docker镜像,几条命令就能在CPU或GPU上启动一个转录服务,团队可以快速获得可用的端点,不必写一堆胶水代码。后端支持多种识别引擎,包括原版Whisper、faster-whisper和WhisperX,它们各有侧重,WhisperX还带说话人分离功能,所以选择引擎不只是性能差异,也关乎功能需求。输出格式涵盖纯文本、JSON、SRT、VTT和TSV,并支持词级时间戳,方便接入字幕生成或会议纪要的流程。此外,借助FFmpeg,它能处理常见的音视频文件,而不是只接受干净的WAV输入,这对处理现实世界中各种嘈杂的媒体素材很有帮助。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。