#203 · 主分类: 语音合成与识别

SpecAugment

data-augmentation python pytorch specaugment speech speech-recognition tensorflow

一个使用Tensorflow和Pytorch实现的SpecAugment,由Google Brain提出。

项目最后更新:04/05/22

GitHub Stars

655

Forks数量

134

贡献者数量

7

许可证

Apache-2.0

收录理由

训练语音识别模型时,最头疼的往往是数据不够,模型容易在有限的样本上过拟合。SpecAugment 是 Google Brain 在 2019 年提出的数据增强方法,它直接对声谱图动手,通过时间方向上的扭曲、随机屏蔽连续的频率通道和时间片段,模拟真实语音中常见的失真。这个仓库把该方法封装成一个小巧的库,同时提供了 TensorFlow 和 PyTorch 两个可互换的实现,无论你用的是哪个框架,都能直接嵌入现有流程。对于搭建语音识别管线的开发者来说,这相当于一个现成的正则化步骤,省去了自己复现论文细节的麻烦,能快速提升模型的泛化能力。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目