GitHub Stars
7.7K
Forks数量
1.3K
贡献者数量
4
许可证
Apache-2.0
收录理由
大多数数字人视频模型只能生成十几秒的短片段,而InfiniteTalk的生成长度可以跟随音频轨道无限延伸,这意味着给一整段剧情、播客或讲座配音时,不用再手动拼接多个十秒小片段,一次就能完成。使用时只需要提供一张人脸图片或一组稀疏的视频帧,再加上一条语音,模型就能输出与音频同步的唇形、头部动作和面部表情。它同时支持图生视频和视频生视频两种方式,代码和Hugging Face上的模型权重都是公开的,团队可以直接下载运行,而不只是停留在论文层面。作者团队后来还发布了面向更成熟生产环境的新版数字人框架,对于想尝试音频驱动虚拟形象的人来说,InfiniteTalk是一个很好的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。