#187 · 主分类: 视频与动画

JoyVASA

audio-driven-talking-face generative-ai image-animation lip-sync portrait-anination talking-head

基于扩散的肖像与动物动画

项目最后更新:04/16/26

GitHub Stars

877

Forks数量

91

贡献者数量

3

许可证

MIT

收录理由

JoyVASA 能把一张静态人像照片,甚至是动物的照片,变成一段跟随你提供的音频张口说话的动态片段。它的思路不是直接生成整帧画面,而是先把人物的静态面部形状与动态表情、头部运动拆开,再用扩散变换器根据音频直接生成运动序列。由于这两部分是解耦的,同一套流程既能处理人脸,也能处理动物对象,不需要针对每个身份重新训练,而且生成片段通常比许多说话头模型更长,帧间连贯性也更好。模型训练时混合了中英文语音数据,所以对这两种语言都有不错的适应能力。需要说明的是,这是一个偏研究性质的项目,并非开箱即用的成品——你需要自行下载模型权重、配置好 CUDA 环境,并做一些调参工作,才能让输出达到可用的效果。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目