#336 · 主分类: 计算机视觉

lip-reading-deeplearning

3d-convolutional-network computer-vision deep-learning speech-recognition tensorflow

:unlock: 唇语识别 - 使用3D架构的跨音视频识别

项目最后更新:11/07/22

GitHub Stars

1.9K

Forks数量

331

贡献者数量

2

许可证

Apache-2.0

收录理由

这个项目用TensorFlow实现了三维卷积网络,把唇部动作视频和对应语音流放在一起做视听联合识别,属于跨模态的语音识别尝试。它背后有IEEE论文支撑,核心思路是把空间和时间信息同时建模,让视觉和听觉两种信号互相补充,在音频嘈杂甚至缺失时依然能靠口型推断内容。仓库里还附带了一个唇部追踪脚本,能从输入视频里提取并可视化嘴部区域,对搭建视觉输入管线有直接帮助。作者把特征提取和数据集准备都留给使用者自己处理,所以它更像一份研究参考和复现起点,而不是开箱即用的工具。如果你在做多模态识别或说话人验证,里面的网络结构和预处理思路值得翻一翻。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目