#151 · 主分类: 语音合成与识别
SincNet
artificial-intelligence
asr
audio
audio-processing
cnn
convolutional-neural-networks
deep-learning
digital-signal-processing
filtering
neural-networks
python
pytorch
signal-processing
speaker-identification
speaker-recognition
speaker-verification
speech-processing
speech-recognition
timit
waveform
SincNet 是一种高效处理原始音频样本的神经架构。
项目最后更新:04/28/21
GitHub Stars
1.2K
Forks数量
272
贡献者数量
5
许可证
MIT
收录理由
SincNet 从原始音频波形直接入手解决说话人识别与验证问题,跳过了 MFCC 这类手工设计特征。其核心创新在于第一层卷积由参数化的 sinc 函数构成,这些函数天然实现带通滤波;模型只学习低截止频率和高截止频率,而不是像普通 CNN 那样逐点学习所有滤波器系数。这样前端既紧凑又可解释,同时仍能根据具体数据自适应调整。仓库提供了从数据准备、训练到评估的完整流程,并附带一个在 TIMIT 上可运行的说话人识别实验,既可作为论文的参考实现,也能作为自己实验的起点。需要注意的是,这是研究性质的代码,相关思想后续被整合进 SpeechBrain,实际使用时需自行改造适配,而非直接用于生产。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。