GitHub Stars
3.3K
Forks数量
291
贡献者数量
5
许可证
Other
收录理由
Sonic 只需一张静态人像和一段音频,就能生成口型同步的动画,且头部动作完全由音频本身驱动,无需参考动作帧。它先捕捉整段音频的全局语境,再将其拆分为短程与长程感知,让面部表情和头部姿态可以分别控制。这样一来,生成的片段即使拉长到几分钟也能保持稳定,头部运动相比许多早期的说话头模型显得更自然、更多样。CVPR 2025 的论文和参考实现为做音频驱动视频的研究者提供了扎实的起点。需要提醒的是,该项目采用非商业的 Creative Commons 许可,更适合学术实验,而非商业产品开发。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。