#318 · 主分类: 视频与动画

nuwa-pytorch

artificial-intelligence attention-mechanism deep-learning text-to-audio text-to-video transformers

NÜWA的实现,最先进的注意力网络,用于文本到视频合成,基于Pytorch

项目最后更新:01/17/23

GitHub Stars

548

Forks数量

55

贡献者数量

1

许可证

MIT

收录理由

这是NÜWA模型的PyTorch实现,源自2021年那篇论文,专注文本生成视频的注意力网络,而且覆盖了从训练到推理的完整流程。你可以先训练一个VQGAN风格的VAE,把视频帧转成离散token,再训练一个transformer,把文本或分割草图映射成视频序列,最后通过生成接口采样出画面。代码里还带了一个双解码器的扩展版本,能同时生成视频和音频,而草图条件控制则让生成过程有更多可操作的空间。整体风格延续了lucidrains系列的一贯做法,超参数可调,支持pip安装,对想复现论文或尝试自回归视频生成的研究者来说,是个不错的起点。不过要提醒的是,这属于研究性质的实现,并非开箱即用的产品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目