#204 · 主分类: 视频与动画

hallo2

[ICLR 2025] Hallo2:长时间高分辨率音频驱动的人像图像动画

项目最后更新:02/27/25

GitHub Stars

3.7K

Forks数量

544

贡献者数量

7

许可证

MIT

收录理由

对着单张人像照片和一段音频,就能生成说话视频,这是Hallo2最直接的价值。它让静态面孔随着语音动起来,表情和头部姿态保持自然,身份特征也不会跑偏。真正少见的是,它不满足于几秒钟的短视频——官方演示里有23分钟、4K分辨率的完整演讲片段,这种长时程的稳定性,多数演示级项目根本不会去碰。仓库提供了完整的推理脚本,预训练权重挂在Hugging Face上,你只需要准备一张正面裁剪的肖像和英文WAV文件,就能跑出成片,不用自己训练模型。对做配音、数字人或者讲座类内容的人来说,这是个很实用的起点。当然,它要求英文音频和A100级别的显卡,门槛不算低。但代码和权重都开源,想自己搭建人像动画管线的团队,拿它当基线也相当顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目