#87 · 主分类: 语音合成与识别
Fun-ASR
开源基于LLM的ASR模型系列,支持中文、方言、口音和多语言语音,提供FunASR、vLLM、流式和llama.cpp运行时。
项目最后更新:08/27/26
GitHub Stars
1.5K
Forks数量
148
贡献者数量
10
许可证
Apache-2.0
收录理由
很多语音识别模型一碰到中文方言或带口音的普通话就容易翻车,而这个来自通义实验室的模型家族恰恰在这些场景上下了功夫。Nano 版本用数千万小时的中文、英文、日文和方言音频训练,另一个 800M 参数的 MLT-Nano 变体则把覆盖面扩展到 31 种语言。两个模型都能配合 FunASR 做推理和服务,vLLM 支持批量转写,llama.cpp 路径则让 GGUF 模型可以在边缘设备上跑。仓库里的可运行示例覆盖了流式转写和说话人分离,从克隆到跑通流程并不费劲。如果你不想依赖封闭的 ASR API,尤其要处理大量中文内容,这里是个实在的入手点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。