#107 · 主分类: 语音合成与识别

FireRedASR

asr automatic-speech-recognition conformer industrial-grade llm multimodal-llm open-source speech-recognition speechllm transformer

开源工业级ASR模型,支持普通话、中文方言和英语,在公开普通话ASR基准上达到新SOTA,同时具备出色的歌词识别能力。

项目最后更新:02/25/26

GitHub Stars

2.0K

Forks数量

165

贡献者数量

5

许可证

Apache-2.0

收录理由

FireRedASR 是一套开源的工业级语音识别模型,包含两个可直接运行的版本:一个侧重效率的编码器-解码器模型,以及一个基于大语言模型的更大规模版本。用户可以根据实际部署环境,在延迟、内存占用和识别准确率之间灵活取舍。它支持普通话、中文方言和英语的转录,在公开中文语音基准上的错误率处于领先水平,这对于将转写结果用于搜索、实时字幕或下游语言模型处理的场景尤其重要。此外,它还能识别歌唱歌词,这一功能在主流工具中很少见。使用起来很简单:从 Hugging Face 下载权重,将音频转换为 16 kHz 的 PCM 格式,然后通过命令行或 Python 接口处理单个文件或批量任务。需要注意的是,AED 版本每次调用大约处理 60 秒音频,LLM 版本约 30 秒,所以更长的录音需要先进行切分。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目