#240 · 主分类: 视频与动画
JoyHallo
audio-driven-talking-face
generative-ai
mandarin-chinese
JoyHallo: 普通话数字人模型
项目最后更新:09/21/25
GitHub Stars
521
Forks数量
52
贡献者数量
1
许可证
MIT
收录理由
JoyHallo 能把一张人像照片和一段音频变成会说话的视频,嘴型、表情和头部动作都会跟着语音走。它专门为普通话设计,用中文 wav2vec2 编码器处理汉语里那些复杂的口型变化,作者也说它仍能生成像样的英文片段,跨语言能力不错。项目自带 Gradio 演示和命令行推理,还支持用你自己的肖像视频数据做微调。要是你打算改模型而不是只跑一下,它那种把嘴型、表情和姿态特征分开处理的半解耦结构值得研究。整体上是个研究级别的代码库,需要一块够强的 GPU,数据准备也得细心,不是拿来即用的产品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。