#151 · 主分类: 语音合成与识别

SincNet

artificial-intelligence asr audio audio-processing cnn convolutional-neural-networks deep-learning digital-signal-processing filtering neural-networks python pytorch signal-processing speaker-identification speaker-recognition speaker-verification speech-processing speech-recognition timit waveform

SincNet 是一种高效处理原始音频样本的神经架构。

项目最后更新:04/28/21

GitHub Stars

1.2K

Forks数量

272

贡献者数量

5

许可证

MIT

收录理由

SincNet 从原始音频波形直接入手解决说话人识别与验证问题,跳过了 MFCC 这类手工设计特征。其核心创新在于第一层卷积由参数化的 sinc 函数构成,这些函数天然实现带通滤波;模型只学习低截止频率和高截止频率,而不是像普通 CNN 那样逐点学习所有滤波器系数。这样前端既紧凑又可解释,同时仍能根据具体数据自适应调整。仓库提供了从数据准备、训练到评估的完整流程,并附带一个在 TIMIT 上可运行的说话人识别实验,既可作为论文的参考实现,也能作为自己实验的起点。需要注意的是,这是研究性质的代码,相关思想后续被整合进 SpeechBrain,实际使用时需自行改造适配,而非直接用于生产。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目