#145 · 主分类: 视频与动画
MOVA
diffusion-models
multimodal
sglang
video-audio-generation
MOVA:迈向可扩展与同步的视频-音频生成
项目最后更新:08/29/26
GitHub Stars
1.1K
Forks数量
91
贡献者数量
11
许可证
Apache-2.0
收录理由
开源视频生成工具大多只能产出无声画面,音画同步得靠你自己另想办法。MOVA 是少数能把视频和配乐一次生成出来的全开源项目,说话时口型对得上,音效也跟动作走,不会出现漂移。它内部用交叉注意力把预训练的视频模型和音频模型接在一起,用过扩散模型工具的人会觉得很顺手。仓库里不只有权重,还有推理代码、能在单张 4090 上跑的 CPU 卸载方案、ComfyUI 集成和 LoRA 微调脚本,拿来就能干活。它还自带了口型同步和音视频对齐的评测指标,想比较不同模型在说话人头或多语言旁白场景下的表现时,就有了明确的判断依据。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。