#14 · 主分类: 语音合成与识别

FunASR

asr audio chinese emotion-recognition funasr mcp-server multilingual-asr openai-compatible-api paraformer punctuation pytorch real-time-asr speaker-diarization speech-recognition speech-to-text streaming-asr transcription vllm voice-activity-detection whisper-alternative

开源语音识别工具包,用于训练、推理、流式ASR、VAD、标点、说话人分离流水线,以及OpenAI兼容/MCP服务。

项目最后更新:08/29/26

GitHub Stars

20.1K

Forks数量

2.0K

贡献者数量

200

许可证

MIT

收录理由

FunASR 并非单一模型,而是一套完整的语音识别工具包,这使它特别适合实际的语音转写工作。你可以按需替换不同的识别器:低延迟的流式模型用于实时通话,覆盖 31 种语言的多语种检查点,或者轻量级、对 CPU 友好的模型,还能同时标注情绪和音频事件。一次 AutoModel 调用就能把语音活动检测、说话人分离和标点串联起来,返回的是带说话人标签和时间戳的结构化文本,而不是一段原始转写。如果不想按分钟支付云端费用,自托管也很方便——OpenAI 兼容的服务端和 MCP 服务端能轻松把转写能力接入你自己的智能体。它对中文和方言口音较重的音频处理得尤其好,而且迁移指南让从 Whisper 或云服务商过来的团队可以先拿代表性音频测试,再决定是否切换。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目