#228 · 主分类: 视频与动画
diffusion-forcing-transformer
[ICML 2025] “历史引导视频扩散”的官方PyTorch实现
项目最后更新:07/01/25
GitHub Stars
709
Forks数量
40
贡献者数量
2
许可证
MIT
收录理由
Diffusion Forcing Transformer(DFoT)是ICML 2025论文《History-Guided Video Diffusion》的官方PyTorch实现,它直面视频生成中一个很实际的问题:到底该用多少帧上下文来引导生成。这个模型不挑输入,任意数量的上下文帧都能接受,所以同一套权重既能拿一张静态照片生成动态视频,也能把一段短片续写得更长,还能在两段相隔较远的画面之间做插值。随代码一起发布的History Guidance方法,在生成长序列时能稳住时间一致性和运动质量,而长视频的稳定生成恰恰是很多视频模型容易翻车的地方。仓库提供了预训练权重和详细的开发文档,复现结果不费劲;HuggingFace Spaces上还有浏览器演示,不用先烧GPU就能上手试玩。需要说明的是,这毕竟是一份研究代码,不是打磨好的产品,训练部分得自己搭环境,但用现成权重跑推理是很顺畅的。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。