#248 · 主分类: 视频与动画

magvit2-pytorch

artificial-intelligence attention-mechanisms deep-learning finite-scalar-quantization transformers video-generation

MagViT2 Tokenizer 的 Pytorch 实现

项目最后更新:01/12/25

GitHub Stars

668

Forks数量

34

贡献者数量

6

许可证

MIT

收录理由

MagViT2 的 tokenizer 让视频模型可以在 token 空间而非原始像素上工作,这个仓库是论文《Language Model Beats Diffusion》中该方法的可读 PyTorch 实现。它通过有限标量量化把视频压缩成离散编码,使 transformer 能够把帧当作 token 序列来学习生成或理解,而不是直接建模像素。仓库自带训练脚本,已经接好了对抗损失、多尺度判别器损失、EMA 跟踪和 Weights & Biases 日志,省去了实验时的大量样板代码。代码更偏研究原型而非打磨好的库,超参数需要自己调,但如果你想复现或改造这个思路,它是很扎实的参考。腾讯基于这个代码库开源了一个可用模型,也说明它确实能跑起来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目