#255 · 主分类: 视频与动画
Text2Video-Zero
[ICCV 2023 Oral] 文本到图像扩散模型是零样本视频生成器
项目最后更新:05/06/23
GitHub Stars
4.2K
Forks数量
388
贡献者数量
11
许可证
Other
收录理由
这个项目提供了一条很实际的路径:不需要专门训练视频模型,直接拿现成的 Stable Diffusion 模型,通过在隐空间里引导运动,就能生成时间上连贯的视频。官方代码覆盖了纯文本生成视频、姿态或边缘条件控制、深度控制,还有基于 Instruct-Pix2Pix 的指令式视频编辑,一个代码库就能应对多种工作流。如果你已经熟悉 Stable Diffusion,上手会非常顺手,而且可以加载 Hugging Face 上任意托管的基础模型或 DreamBooth 微调模型,现有模型能直接复用。作为 ICCV 2023 论文的官方参考实现,它也是想深入理解方法本身的研究者很好的切入点,而不是仅仅调用一个黑盒 API。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。