GitHub Stars
3.7K
Forks数量
544
贡献者数量
7
许可证
MIT
收录理由
对着单张人像照片和一段音频,就能生成说话视频,这是Hallo2最直接的价值。它让静态面孔随着语音动起来,表情和头部姿态保持自然,身份特征也不会跑偏。真正少见的是,它不满足于几秒钟的短视频——官方演示里有23分钟、4K分辨率的完整演讲片段,这种长时程的稳定性,多数演示级项目根本不会去碰。仓库提供了完整的推理脚本,预训练权重挂在Hugging Face上,你只需要准备一张正面裁剪的肖像和英文WAV文件,就能跑出成片,不用自己训练模型。对做配音、数字人或者讲座类内容的人来说,这是个很实用的起点。当然,它要求英文音频和A100级别的显卡,门槛不算低。但代码和权重都开源,想自己搭建人像动画管线的团队,拿它当基线也相当顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。