#14 · 主分类: 语音合成与识别
FunASR
开源语音识别工具包,用于训练、推理、流式ASR、VAD、标点、说话人分离流水线,以及OpenAI兼容/MCP服务。
项目最后更新:08/29/26
GitHub Stars
20.1K
Forks数量
2.0K
贡献者数量
200
许可证
MIT
收录理由
FunASR 并非单一模型,而是一套完整的语音识别工具包,这使它特别适合实际的语音转写工作。你可以按需替换不同的识别器:低延迟的流式模型用于实时通话,覆盖 31 种语言的多语种检查点,或者轻量级、对 CPU 友好的模型,还能同时标注情绪和音频事件。一次 AutoModel 调用就能把语音活动检测、说话人分离和标点串联起来,返回的是带说话人标签和时间戳的结构化文本,而不是一段原始转写。如果不想按分钟支付云端费用,自托管也很方便——OpenAI 兼容的服务端和 MCP 服务端能轻松把转写能力接入你自己的智能体。它对中文和方言口音较重的音频处理得尤其好,而且迁移指南让从 Whisper 或云服务商过来的团队可以先拿代表性音频测试,再决定是否切换。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。