#240 · 主分类: 视频与动画

JoyHallo

audio-driven-talking-face generative-ai mandarin-chinese

JoyHallo: 普通话数字人模型

项目最后更新:09/21/25

GitHub Stars

521

Forks数量

52

贡献者数量

1

许可证

MIT

收录理由

JoyHallo 能把一张人像照片和一段音频变成会说话的视频,嘴型、表情和头部动作都会跟着语音走。它专门为普通话设计,用中文 wav2vec2 编码器处理汉语里那些复杂的口型变化,作者也说它仍能生成像样的英文片段,跨语言能力不错。项目自带 Gradio 演示和命令行推理,还支持用你自己的肖像视频数据做微调。要是你打算改模型而不是只跑一下,它那种把嘴型、表情和姿态特征分开处理的半解耦结构值得研究。整体上是个研究级别的代码库,需要一块够强的 GPU,数据准备也得细心,不是拿来即用的产品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目