#255 · 主分类: 视频与动画

Text2Video-Zero

video-editing video-generation

[ICCV 2023 Oral] 文本到图像扩散模型是零样本视频生成器

项目最后更新:05/06/23

GitHub Stars

4.2K

Forks数量

388

贡献者数量

11

许可证

Other

收录理由

这个项目提供了一条很实际的路径:不需要专门训练视频模型,直接拿现成的 Stable Diffusion 模型,通过在隐空间里引导运动,就能生成时间上连贯的视频。官方代码覆盖了纯文本生成视频、姿态或边缘条件控制、深度控制,还有基于 Instruct-Pix2Pix 的指令式视频编辑,一个代码库就能应对多种工作流。如果你已经熟悉 Stable Diffusion,上手会非常顺手,而且可以加载 Hugging Face 上任意托管的基础模型或 DreamBooth 微调模型,现有模型能直接复用。作为 ICCV 2023 论文的官方参考实现,它也是想深入理解方法本身的研究者很好的切入点,而不是仅仅调用一个黑盒 API。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目