#242 · 主分类: 视频与动画

make-a-video-pytorch

artificial-intelligence attention-mechanisms axial-convolutions deep-learning text-to-video

Make-A-Video的实现,来自Meta AI的新SOTA文本到视频生成器,基于Pytorch

项目最后更新:05/03/24

GitHub Stars

2.0K

Forks数量

185

贡献者数量

2

许可证

MIT

收录理由

Meta 的 Make-A-Video 核心思路,是给一个强大的文生图扩散模型装上时间感知能力。这个 PyTorch 实现把关键步骤拆解得明明白白:用伪三维轴向卷积在帧之间低成本地融合信息,再用时空注意力捕捉长程运动。时间层被设计成遇到二维图像张量时自动跳过,并初始化为恒等映射,这意味着你可以先用图像训练一个现成的二维 U-Net,之后再无缝切到视频,无需改动任何结构。代码里还提供了时间训练开关和可选的 flash-attention 路径,想把自己扩散流程里的模块替换进去并不费劲。不过要留意,这是对论文的讲解式复现,并非开箱即用的文生视频服务,训练和采样周边的逻辑还得你自己动手补齐。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目