#19 · 主分类: 语音合成与识别

speechbrain

asr audio audio-processing deep-learning huggingface language-model pytorch speaker-diarization speaker-recognition speaker-verification speech-enhancement speech-processing speech-recognition speech-separation speech-to-text speech-toolkit speechrecognition spoken-language-understanding transformers voice-recognition

一个基于PyTorch的语音工具包

项目最后更新:08/27/26

GitHub Stars

11.8K

Forks数量

1.7K

贡献者数量

283

许可证

Apache-2.0

收录理由

如果你的工作涉及音频,SpeechBrain 几乎是你能找到的最完整的起点之一。它是一个基于 PyTorch 的工具包,把语音识别、说话人识别与验证、语音增强、语音分离以及口语理解都整合在同一个代码库里,共享同一套训练和推理流程。你不需要从不同库中拼凑组件,它提供了数百个可复现的训练配方,覆盖几十个数据集,既适合从零训练自定义模型,也适合对 HuggingFace 上发布的预训练检查点进行微调。由于所有任务共享同一架构,你还可以把不同环节串联起来,比如将识别结果直接喂给下游的语言或对话模块。文档和教程都很扎实,而最近加入的 EEG 支持也透露出这个项目更大的野心。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目