GitHub Stars
1.9K
Forks数量
192
贡献者数量
12
许可证
Apache-2.0
收录理由
这是Latte的官方PyTorch实现,一个用于视频生成的潜在扩散Transformer。仓库提供了基于FaceForensics、SkyTimelapse、UCF101和Taichi-HD训练的预训练权重,还有一个更高分辨率的文本到视频模型,让你在决定从头训练之前就能直接检验真实输出效果。除了采样脚本,它还包含了分布式训练和评估代码,对于想要把基于Transformer的扩散方法迁移到自己视频任务上的团队来说,是个实用的起点。模型还能接入diffusers库,推理时使用4/8位量化可以明显减少GPU内存占用。文档覆盖了架构变体和消融实验的选择,当你想弄清楚某个设计决策为何更优时,会很有帮助。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。