#101 · 主分类: 语音合成与识别

MMAudio

audio audio-synthesis computer-vision deep-learning text-to-audio video-to-audio

[CVPR 2025] MMAudio:驯服多模态联合训练以实现高质量视频到音频合成

项目最后更新:02/23/26

GitHub Stars

2.3K

Forks数量

267

贡献者数量

3

许可证

MIT

收录理由

MMAudio 出自 CVPR 2025 论文,能根据一段视频(可搭配文字提示)生成与画面同步的音频。它专门设计了一个同步模块,让声音紧密贴合视觉内容,很适合为无声的库存素材或 Sora、Veo 这类不产声音的生成视频补上音效。仓库里提供了预训练权重,还有 Colab 和 Replicate 在线演示,不用自己搭环境就能先听效果。如果你常做短视频,又不想依赖封闭的商用音频接口,这个项目值得一试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目