#55 · 主分类: 语音合成与识别

whisper-asr-webservice

asr automatic-speech-recognition docker openai-whisper speech speech-recognition speech-to-text

OpenAI Whisper ASR Web服务 API

项目最后更新:08/09/26

GitHub Stars

3.3K

Forks数量

584

贡献者数量

20

许可证

MIT

收录理由

这个项目把OpenAI的Whisper语音识别模型包装成一个简洁的HTTP接口,省去了自己搭建服务层的麻烦。它提供了现成的Docker镜像,几条命令就能在CPU或GPU上启动一个转录服务,团队可以快速获得可用的端点,不必写一堆胶水代码。后端支持多种识别引擎,包括原版Whisper、faster-whisper和WhisperX,它们各有侧重,WhisperX还带说话人分离功能,所以选择引擎不只是性能差异,也关乎功能需求。输出格式涵盖纯文本、JSON、SRT、VTT和TSV,并支持词级时间戳,方便接入字幕生成或会议纪要的流程。此外,借助FFmpeg,它能处理常见的音视频文件,而不是只接受干净的WAV输入,这对处理现实世界中各种嘈杂的媒体素材很有帮助。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目