#228 · 主分类: 视频与动画

diffusion-forcing-transformer

diffusion-models generative-ai image-to-video transformer video-generation

[ICML 2025] “历史引导视频扩散”的官方PyTorch实现

项目最后更新:07/01/25

GitHub Stars

709

Forks数量

40

贡献者数量

2

许可证

MIT

收录理由

Diffusion Forcing Transformer(DFoT)是ICML 2025论文《History-Guided Video Diffusion》的官方PyTorch实现,它直面视频生成中一个很实际的问题:到底该用多少帧上下文来引导生成。这个模型不挑输入,任意数量的上下文帧都能接受,所以同一套权重既能拿一张静态照片生成动态视频,也能把一段短片续写得更长,还能在两段相隔较远的画面之间做插值。随代码一起发布的History Guidance方法,在生成长序列时能稳住时间一致性和运动质量,而长视频的稳定生成恰恰是很多视频模型容易翻车的地方。仓库提供了预训练权重和详细的开发文档,复现结果不费劲;HuggingFace Spaces上还有浏览器演示,不用先烧GPU就能上手试玩。需要说明的是,这毕竟是一份研究代码,不是打磨好的产品,训练部分得自己搭环境,但用现成权重跑推理是很顺畅的。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目