#84 · 主分类: 语音合成与识别

audiomentations

audio audio-data-augmentation audio-effects augmentation data-augmentation deep-learning dsp machine-learning music python sound sound-processing

一个用于音频数据增强的Python库。有助于让音频机器学习模型在现实世界中表现良好,而不仅仅是在实验室中。

项目最后更新:04/13/26

GitHub Stars

2.3K

Forks数量

220

贡献者数量

34

许可证

MIT

收录理由

只用一份干净数据集训练出来的音频模型,一遇到真实世界的录音往往就失灵——背景人声、房间混响、压缩痕迹都会让模型表现大打折扣。Audiomentations 正好补上这一环,它提供了一整套开箱即用的扰动手段:加噪、变调变速、脉冲响应、均衡滤波、增益渐变,甚至模拟 mp3 压缩。每个变换都可以单独设定触发概率,用起来像搭积木一样拼出一条随机增强流程,省去手工调参的麻烦。它的接口模仿了 albumentations,做过图像增强的人几乎不用额外学习就能上手,几分钟内就能搭出一个可用的 Compose 链。库本身跑在 CPU 上,支持单声道和多声道音频,也能直接嵌进 TensorFlow/Keras 或 PyTorch 的训练循环,无论是做语音识别、声音分类还是音乐相关任务,都很顺手。如果用的是 PyTorch 又想要 GPU 加速,旁边还有配套的 torch-audiomentations 可以切换。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目