#129 · 主分类: 视频与动画

Latte

[TMLR 2025] Latte:用于视频生成的潜在扩散变换器。

项目最后更新:08/10/26

GitHub Stars

1.9K

Forks数量

192

贡献者数量

12

许可证

Apache-2.0

收录理由

这是Latte的官方PyTorch实现,一个用于视频生成的潜在扩散Transformer。仓库提供了基于FaceForensics、SkyTimelapse、UCF101和Taichi-HD训练的预训练权重,还有一个更高分辨率的文本到视频模型,让你在决定从头训练之前就能直接检验真实输出效果。除了采样脚本,它还包含了分布式训练和评估代码,对于想要把基于Transformer的扩散方法迁移到自己视频任务上的团队来说,是个实用的起点。模型还能接入diffusers库,推理时使用4/8位量化可以明显减少GPU内存占用。文档覆盖了架构变体和消融实验的选择,当你想弄清楚某个设计决策为何更优时,会很有帮助。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目