#119 · 主分类: 语音合成与识别

GigaAM

emotion-recognition foundation-models self-supervised-learning speech-recognition

语音识别任务的基础模型

项目最后更新:08/17/26

GitHub Stars

771

Forks数量

102

贡献者数量

6

许可证

MIT

收录理由

GigaAM 是一套基于 Conformer 架构的开源声学模型,在俄语语音识别上取得了当前领先的效果,其后续推出的多语言版本将同一套方法扩展到了 70 多种语言。仓库提供了预训练好的 CTC 和 RNN-T 检查点,可以直接加载并对短音频调用 transcribe() 完成识别,也支持带词级时间戳的长语音转录。同一个编码器还支撑了情感识别模型,因此一条音频处理链路既能做转写,也能做情感分析。微调流程基于 PyTorch Lightning 实现,同时提供了 ONNX 导出和 Triton 推理服务器支持,方便对接生产环境。对于正在构建呼叫中心分析、语音助手或多语言转录系统的开发者来说,这是一个采用 MIT 许可、上手门槛较低的实用起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目