#215 · 主分类: 视频与动画

Pyramid-Flow

diffusion-models flow-matching video-generation

[ICLR 2025] 金字塔流匹配用于高效视频生成建模

项目最后更新:12/21/24

GitHub Stars

3.2K

Forks数量

303

贡献者数量

15

许可证

MIT

收录理由

Pyramid Flow 把文本或图片变成短视频,靠的是一套分层匹配的流程,画面按分辨率逐级生成。这种金字塔式的结构让训练开销明显降了下来——作者只用开源数据训练,就能产出 768p、24 帧每秒、最长 10 秒的片段。项目不只有论文,配套工具也齐全:Hugging Face 上有现成权重,DiT 微调代码、VAE 训练代码都放出来了,还支持多卡推理和 CPU 卸载,显存不到 8GB 也能跑起来。想试 text-to-video 或 image-to-video 的团队,拿它当参照实现来拆解、改造,相当顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目