#269 · 主分类: 视频与动画
FaceFormer
[CVPR 2022] FaceFormer:使用Transformer的语音驱动的3D面部动画
项目最后更新:08/22/23
GitHub Stars
917
Forks数量
148
贡献者数量
1
许可证
MIT
收录理由
FaceFormer 仓库提供了 CVPR 2022 论文的 PyTorch 实现,是早期将 Transformer 架构引入语音驱动三维人脸动画的代表性工作。只需输入原始音频和一个中性三维人脸网格,模型就能自回归地预测出一系列面部运动,嘴型准确,还包含上半脸的表情变化,而不只是嘴唇在动。仓库里已经放了 VOCASET 和 BIWI 数据集的预训练权重,下载后直接跑 demo 就能驱动网格动画,不需要先从头训练。代码结构清楚,能看出 wav2vec 2.0 音频特征和偏置注意力是怎么衔接的。对于正在做嘴型同步虚拟形象或数字角色原型的人来说,这是个值得好好研究的学习基线,但别指望它是开箱即用的 SDK——数据集要自己申请,MPI-IS mesh 库得手动装,数据管线也要按自己的角色模型去改。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。