#173 · 主分类: 语音合成与识别
VAD
语音活动检测(VAD)工具包,包括基于DNN、bDNN、LSTM和ACAM的VAD。我们还提供了我们直接录制的数据集。
项目最后更新:06/09/21
GitHub Stars
869
Forks数量
232
贡献者数量
1
许可证
GPL-3.0
收录理由
语音活动检测,也就是从音频流里分辨出人声从哪里开始、在哪里结束,这个小环节往往能决定一个语音系统的成败。这个来自KAIST的仓库一口气提供了四种VAD分类器:普通DNN、增强型DNN、LSTM循环网络,以及自适应上下文注意力模型,它们统一使用多分辨率耳蜗图特征,而不是常见的频谱图。同时它还附带了一份人工标注的数据集,是在四种嘈杂环境下用手机录的,既能拿来跑基准测试,也能让你看看真实训练数据长什么样。需要坦白的是,特征提取得靠MATLAB而且速度偏慢,训练代码也停留在TensorFlow 1.x,所以更适合当作理解完整流程的参考,而不是直接塞进生产环境。想一步步看模型怎么端到端训练的学生,或者在做分段器原型、之后打算换用维护更活跃的库的团队,会从这里面收获最多。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。