#203 · 主分类: 语音合成与识别
SpecAugment
data-augmentation
python
pytorch
specaugment
speech
speech-recognition
tensorflow
一个使用Tensorflow和Pytorch实现的SpecAugment,由Google Brain提出。
项目最后更新:04/05/22
GitHub Stars
655
Forks数量
134
贡献者数量
7
许可证
Apache-2.0
收录理由
训练语音识别模型时,最头疼的往往是数据不够,模型容易在有限的样本上过拟合。SpecAugment 是 Google Brain 在 2019 年提出的数据增强方法,它直接对声谱图动手,通过时间方向上的扭曲、随机屏蔽连续的频率通道和时间片段,模拟真实语音中常见的失真。这个仓库把该方法封装成一个小巧的库,同时提供了 TensorFlow 和 PyTorch 两个可互换的实现,无论你用的是哪个框架,都能直接嵌入现有流程。对于搭建语音识别管线的开发者来说,这相当于一个现成的正则化步骤,省去了自己复现论文细节的麻烦,能快速提升模型的泛化能力。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。