#242 · 主分类: 视频与动画
make-a-video-pytorch
Make-A-Video的实现,来自Meta AI的新SOTA文本到视频生成器,基于Pytorch
项目最后更新:05/03/24
GitHub Stars
2.0K
Forks数量
185
贡献者数量
2
许可证
MIT
收录理由
Meta 的 Make-A-Video 核心思路,是给一个强大的文生图扩散模型装上时间感知能力。这个 PyTorch 实现把关键步骤拆解得明明白白:用伪三维轴向卷积在帧之间低成本地融合信息,再用时空注意力捕捉长程运动。时间层被设计成遇到二维图像张量时自动跳过,并初始化为恒等映射,这意味着你可以先用图像训练一个现成的二维 U-Net,之后再无缝切到视频,无需改动任何结构。代码里还提供了时间训练开关和可选的 flash-attention 路径,想把自己扩散流程里的模块替换进去并不费劲。不过要留意,这是对论文的讲解式复现,并非开箱即用的文生视频服务,训练和采样周边的逻辑还得你自己动手补齐。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。