#146 · 主分类: MLOps与评测

speech-to-text-benchmark

aws-transcribe cheetah deep-learning deep-neural-networks deepspeech edge-ai google-speech-to-text mozilla-deepspeech offline picovoice pocketsphinx privacy speech-recognition speech-to-text voice-recognition

语音转文字基准测试框架

项目最后更新:07/08/26

GitHub Stars

697

Forks数量

72

贡献者数量

5

许可证

Apache-2.0

收录理由

选语音转文字引擎时,多数团队要么轻信厂商宣传,要么自己临时写脚本跑几段音频,结果往往难以横向对比。这个框架把评测流程标准化了:同一批数据集、同一套指标,统一跑在Amazon Transcribe、Azure、Google、IBM Watson、OpenAI Whisper、Whisper.cpp、Vosk以及Picovoice自家引擎上。它给出的指标包括词错误率、标点错误率、每音频小时消耗的CPU时间、流式输出的延迟以及模型体积,覆盖的数据集有LibriSpeech、Common Voice、TED-LIUM等公开语料。对边缘部署来说,这种对比尤其关键——云端API可能准确率领先,但成本和延迟却可能拖后腿。团队可以直接复用已发布的评测结果作为基线,也能把框架扩展到自己手里的音频和语言上。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目