#84 · 主分类: 语音合成与识别
audiomentations
一个用于音频数据增强的Python库。有助于让音频机器学习模型在现实世界中表现良好,而不仅仅是在实验室中。
项目最后更新:04/13/26
GitHub Stars
2.3K
Forks数量
220
贡献者数量
34
许可证
MIT
收录理由
只用一份干净数据集训练出来的音频模型,一遇到真实世界的录音往往就失灵——背景人声、房间混响、压缩痕迹都会让模型表现大打折扣。Audiomentations 正好补上这一环,它提供了一整套开箱即用的扰动手段:加噪、变调变速、脉冲响应、均衡滤波、增益渐变,甚至模拟 mp3 压缩。每个变换都可以单独设定触发概率,用起来像搭积木一样拼出一条随机增强流程,省去手工调参的麻烦。它的接口模仿了 albumentations,做过图像增强的人几乎不用额外学习就能上手,几分钟内就能搭出一个可用的 Compose 链。库本身跑在 CPU 上,支持单声道和多声道音频,也能直接嵌进 TensorFlow/Keras 或 PyTorch 的训练循环,无论是做语音识别、声音分类还是音乐相关任务,都很顺手。如果用的是 PyTorch 又想要 GPU 加速,旁边还有配套的 torch-audiomentations 可以切换。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。