#144 · 主分类: 视频与动画

MultiTalk

[NeurIPS 2025] 让他们说话:音频驱动的多人对话视频生成

项目最后更新:05/22/26

GitHub Stars

3.0K

Forks数量

497

贡献者数量

4

许可证

Apache-2.0

收录理由

MultiTalk 能把多段独立音频合成一段多人对话的逼真视频,画面中几个人有来有回地交谈,系统会自行判断谁在听、谁在反应,而不是逐个生成单人说话再拼接。它也能处理唱歌、卡通形象,以及显式的互动控制,适用范围不限于普通对话。对于想做自动播客、配音流程或交互式虚拟角色演示的开发者和小团队,项目提供的 Hugging Face 模型权重能让他们从论文快速过渡到可运行的原型。如果已经在做单人说话头相关系统,这个项目也会是研究多人协调难题时不错的参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目