#215 · 主分类: 视频与动画
Pyramid-Flow
diffusion-models
flow-matching
video-generation
[ICLR 2025] 金字塔流匹配用于高效视频生成建模
项目最后更新:12/21/24
GitHub Stars
3.2K
Forks数量
303
贡献者数量
15
许可证
MIT
收录理由
Pyramid Flow 把文本或图片变成短视频,靠的是一套分层匹配的流程,画面按分辨率逐级生成。这种金字塔式的结构让训练开销明显降了下来——作者只用开源数据训练,就能产出 768p、24 帧每秒、最长 10 秒的片段。项目不只有论文,配套工具也齐全:Hugging Face 上有现成权重,DiT 微调代码、VAE 训练代码都放出来了,还支持多卡推理和 CPU 卸载,显存不到 8GB 也能跑起来。想试 text-to-video 或 image-to-video 的团队,拿它当参照实现来拆解、改造,相当顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。