#248 · 主分类: 视频与动画
magvit2-pytorch
MagViT2 Tokenizer 的 Pytorch 实现
项目最后更新:01/12/25
GitHub Stars
668
Forks数量
34
贡献者数量
6
许可证
MIT
收录理由
MagViT2 的 tokenizer 让视频模型可以在 token 空间而非原始像素上工作,这个仓库是论文《Language Model Beats Diffusion》中该方法的可读 PyTorch 实现。它通过有限标量量化把视频压缩成离散编码,使 transformer 能够把帧当作 token 序列来学习生成或理解,而不是直接建模像素。仓库自带训练脚本,已经接好了对抗损失、多尺度判别器损失、EMA 跟踪和 Weights & Biases 日志,省去了实验时的大量样板代码。代码更偏研究原型而非打磨好的库,超参数需要自己调,但如果你想复现或改造这个思路,它是很扎实的参考。腾讯基于这个代码库开源了一个可用模型,也说明它确实能跑起来。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。