#254 · 主分类: 视频与动画
phenaki-pytorch
Phenaki Video 的实现,使用 Mask GIT 在 Pytorch 中生成最长 2 分钟的文本引导视频。
项目最后更新:07/29/24
GitHub Stars
789
Forks数量
81
贡献者数量
2
许可证
MIT
收录理由
这个仓库把 Phenaki 视频生成方案用 PyTorch 完整实现了一遍,核心是把 C-ViViT 视频分词器和 MaskGIT 变换器组合起来,让自然语言提示词能直接变成短视频片段。它面向的是想研究或复现这套方法的研究者和机器学习工程师,而不是把它当现成服务来用的终端用户——整个流程都被拆成了可组合、可训练的模块,提供了训练器类和 make_video 辅助函数,后者能按场景逐段生成并用帧做引导,从而拼出更长的输出。代码允许先拿图片训练、再在视频上微调,这样更省样本;也支持矩形分辨率和在一个批次里混合不同长度的片段。另外它还包含了 token-critic 的改进思路,你可以用学出来的 critic 或者干脆让 MaskGIT 模型自己当 self-critic 来提升采样质量。如果你正在琢磨长文本条件视频生成背后的具体机制,这份代码对理解其中的运作细节会很有参考价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。