#187 · 主分类: 视频与动画
JoyVASA
audio-driven-talking-face
generative-ai
image-animation
lip-sync
portrait-anination
talking-head
基于扩散的肖像与动物动画
项目最后更新:04/16/26
GitHub Stars
877
Forks数量
91
贡献者数量
3
许可证
MIT
收录理由
JoyVASA 能把一张静态人像照片,甚至是动物的照片,变成一段跟随你提供的音频张口说话的动态片段。它的思路不是直接生成整帧画面,而是先把人物的静态面部形状与动态表情、头部运动拆开,再用扩散变换器根据音频直接生成运动序列。由于这两部分是解耦的,同一套流程既能处理人脸,也能处理动物对象,不需要针对每个身份重新训练,而且生成片段通常比许多说话头模型更长,帧间连贯性也更好。模型训练时混合了中英文语音数据,所以对这两种语言都有不错的适应能力。需要说明的是,这是一个偏研究性质的项目,并非开箱即用的成品——你需要自行下载模型权重、配置好 CUDA 环境,并做一些调参工作,才能让输出达到可用的效果。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。