#336 · 主分类: 计算机视觉
lip-reading-deeplearning
3d-convolutional-network
computer-vision
deep-learning
speech-recognition
tensorflow
:unlock: 唇语识别 - 使用3D架构的跨音视频识别
项目最后更新:11/07/22
GitHub Stars
1.9K
Forks数量
331
贡献者数量
2
许可证
Apache-2.0
收录理由
这个项目用TensorFlow实现了三维卷积网络,把唇部动作视频和对应语音流放在一起做视听联合识别,属于跨模态的语音识别尝试。它背后有IEEE论文支撑,核心思路是把空间和时间信息同时建模,让视觉和听觉两种信号互相补充,在音频嘈杂甚至缺失时依然能靠口型推断内容。仓库里还附带了一个唇部追踪脚本,能从输入视频里提取并可视化嘴部区域,对搭建视觉输入管线有直接帮助。作者把特征提取和数据集准备都留给使用者自己处理,所以它更像一份研究参考和复现起点,而不是开箱即用的工具。如果你在做多模态识别或说话人验证,里面的网络结构和预处理思路值得翻一翻。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。