GitHub Stars
2.4K
Forks数量
298
贡献者数量
4
许可证
Other
收录理由
V-Express 面向需要在本机完成说话人视频生成的团队,只要提供一张正面人脸照片和一段音频,就能得到口型与语音同步的说话视频。它还支持从其他片段提取姿态关键点序列来驱动头部动作,让人物动起来更自然。项目的核心思路是条件丢弃式渐进训练,让音频这种较弱的控制信号在姿态、身份等强信号干扰下仍然能起作用——很多开源说话头模型恰恰在这个环节上处理不好。仓库同时提供了推理与训练代码,并做了显存优化以支持更长视频,还加入后处理步骤减轻画面闪烁。如果你在搭建配音、数字人或合成语音相关的管线,它的脚本和 Hugging Face 模型卡能帮你从安装到跑通示例快速走完流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。