#318 · 主分类: 视频与动画
nuwa-pytorch
artificial-intelligence
attention-mechanism
deep-learning
text-to-audio
text-to-video
transformers
NÜWA的实现,最先进的注意力网络,用于文本到视频合成,基于Pytorch
项目最后更新:01/17/23
GitHub Stars
548
Forks数量
55
贡献者数量
1
许可证
MIT
收录理由
这是NÜWA模型的PyTorch实现,源自2021年那篇论文,专注文本生成视频的注意力网络,而且覆盖了从训练到推理的完整流程。你可以先训练一个VQGAN风格的VAE,把视频帧转成离散token,再训练一个transformer,把文本或分割草图映射成视频序列,最后通过生成接口采样出画面。代码里还带了一个双解码器的扩展版本,能同时生成视频和音频,而草图条件控制则让生成过程有更多可操作的空间。整体风格延续了lucidrains系列的一贯做法,超参数可调,支持pip安装,对想复现论文或尝试自回归视频生成的研究者来说,是个不错的起点。不过要提醒的是,这属于研究性质的实现,并非开箱即用的产品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。