#145 · 主分类: 视频与动画

MOVA

diffusion-models multimodal sglang video-audio-generation

MOVA:迈向可扩展与同步的视频-音频生成

项目最后更新:08/29/26

GitHub Stars

1.1K

Forks数量

91

贡献者数量

11

许可证

Apache-2.0

收录理由

开源视频生成工具大多只能产出无声画面,音画同步得靠你自己另想办法。MOVA 是少数能把视频和配乐一次生成出来的全开源项目,说话时口型对得上,音效也跟动作走,不会出现漂移。它内部用交叉注意力把预训练的视频模型和音频模型接在一起,用过扩散模型工具的人会觉得很顺手。仓库里不只有权重,还有推理代码、能在单张 4090 上跑的 CPU 卸载方案、ComfyUI 集成和 LoRA 微调脚本,拿来就能干活。它还自带了口型同步和音视频对齐的评测指标,想比较不同模型在说话人头或多语言旁白场景下的表现时,就有了明确的判断依据。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目