#28 · 主分类: 语音合成与识别

SenseVoice

asr audio-analysis audio-event-detection cantonese cross-lingual emotion-detection funasr language-identification llama-cpp multilingual multilingual-asr pytorch sensevoice speech-emotion-recognition speech-recognition speech-to-text speech-understanding transcription voice-ai whisper-alternative

开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语种识别、情感识别和音频事件检测。

项目最后更新:08/27/26

GitHub Stars

9.2K

Forks数量

814

贡献者数量

25

许可证

MIT

收录理由

面向东亚用户的语音产品,过去往往得为每种语言单独训练或采购ASR模型,还得额外搭语言识别和情绪检测的模块。SenseVoiceSmall把转写、语种识别、情绪识别和音频事件检测整合在一次推理里,一个模型就能输出文本以及笑声、掌声、咳嗽这类上下文标签。开箱即用支持普通话、粤语、英语、日语和韩语,基本覆盖该区域主要市场,一套工具就能搞定。非自回归解码器把延迟压得较低,实时转写和通话分析都跑得动。MIT许可,微调不折腾,文档把环境配置讲得很清楚,还和FunASR打通,部署前拿它和Whisper对比测试也方便。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目