#87 · 主分类: 语音合成与识别

Fun-ASR

31-languages asr audio audio-language-model chinese-dialects fun-asr fun-asr-nano funasr gguf llama-cpp llm-asr multilingual-asr on-device pytorch real-time-asr speaker-diarization speech-recognition speech-to-text transcription whisper-alternative

开源基于LLM的ASR模型系列,支持中文、方言、口音和多语言语音,提供FunASR、vLLM、流式和llama.cpp运行时。

项目最后更新:08/27/26

GitHub Stars

1.5K

Forks数量

148

贡献者数量

10

许可证

Apache-2.0

收录理由

很多语音识别模型一碰到中文方言或带口音的普通话就容易翻车,而这个来自通义实验室的模型家族恰恰在这些场景上下了功夫。Nano 版本用数千万小时的中文、英文、日文和方言音频训练,另一个 800M 参数的 MLT-Nano 变体则把覆盖面扩展到 31 种语言。两个模型都能配合 FunASR 做推理和服务,vLLM 支持批量转写,llama.cpp 路径则让 GGUF 模型可以在边缘设备上跑。仓库里的可运行示例覆盖了流式转写和说话人分离,从克隆到跑通流程并不费劲。如果你不想依赖封闭的 ASR API,尤其要处理大量中文内容,这里是个实在的入手点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目