#203 · 主分类: 视频与动画

EMO

表情肖像活起来:在弱条件下使用音频到视频扩散模型生成富有表现力的肖像视频

项目最后更新:08/21/24

GitHub Stars

7.6K

Forks数量

928

贡献者数量

3

许可证

Other

收录理由

EMO 出自阿里巴巴智能计算研究院,相关工作发表在 ECCV 2024 上。只需一张人像照片和一段音频,它就能生成面部动作与语音或歌声同步的视频,表情变化由音频驱动扩散模型完成,且只需弱条件约束,无需针对每个对象单独微调。仓库提供了论文对应的官方推理代码和权重,适合直接复现实验结果,也可以作为自研数字人、虚拟主播等流程的改造基础。代码属于研究型实现,并非开箱即用的产品,环境搭建和推理周边的逻辑需要自己动手补齐。对想要一个具体、可引用的音频转视频模型来做二次开发的研发人员来说,这个取舍是划算的。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目