GitHub Stars
4.4K
Forks数量
388
贡献者数量
3
许可证
Apache-2.0
收录理由
Tune-A-Video 是 ICCV 2023 论文的官方实现,展示了仅凭一段视频和对应的文本描述,就能让预训练的文生图扩散模型学会生成新视频。代码库紧凑且易读,这很重要——因为其核心思路是微调注意力层并借助 DDIM 反演来保证时序一致性,这类关键技巧在多数研究仓库里往往被淹没。项目提供了 Hugging Face 上的预训练权重、训练界面的 Space 以及 Colab 笔记本,你可以直接复现流程,再换成自己的视频和提示词来试验。作为该方向最早开放的项目之一,它也是理解后来文本生成视频方法如何从图像扩散模型演化而来的一个方便参照。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。