#19 · 主分类: 语音合成与识别
speechbrain
asr
audio
audio-processing
deep-learning
huggingface
language-model
pytorch
speaker-diarization
speaker-recognition
speaker-verification
speech-enhancement
speech-processing
speech-recognition
speech-separation
speech-to-text
speech-toolkit
speechrecognition
spoken-language-understanding
transformers
voice-recognition
一个基于PyTorch的语音工具包
项目最后更新:08/27/26
GitHub Stars
11.8K
Forks数量
1.7K
贡献者数量
283
许可证
Apache-2.0
收录理由
如果你的工作涉及音频,SpeechBrain 几乎是你能找到的最完整的起点之一。它是一个基于 PyTorch 的工具包,把语音识别、说话人识别与验证、语音增强、语音分离以及口语理解都整合在同一个代码库里,共享同一套训练和推理流程。你不需要从不同库中拼凑组件,它提供了数百个可复现的训练配方,覆盖几十个数据集,既适合从零训练自定义模型,也适合对 HuggingFace 上发布的预训练检查点进行微调。由于所有任务共享同一架构,你还可以把不同环节串联起来,比如将识别结果直接喂给下游的语言或对话模块。文档和教程都很扎实,而最近加入的 EEG 支持也透露出这个项目更大的野心。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。