GitHub Stars
7.6K
Forks数量
928
贡献者数量
3
许可证
Other
收录理由
EMO 出自阿里巴巴智能计算研究院,相关工作发表在 ECCV 2024 上。只需一张人像照片和一段音频,它就能生成面部动作与语音或歌声同步的视频,表情变化由音频驱动扩散模型完成,且只需弱条件约束,无需针对每个对象单独微调。仓库提供了论文对应的官方推理代码和权重,适合直接复现实验结果,也可以作为自研数字人、虚拟主播等流程的改造基础。代码属于研究型实现,并非开箱即用的产品,环境搭建和推理周边的逻辑需要自己动手补齐。对想要一个具体、可引用的音频转视频模型来做二次开发的研发人员来说,这个取舍是划算的。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。