#301 · 主分类: 计算机视觉

VideoMAE

action-recognition mae masked-autoencoder neurips-2022 pytorch self-supervised-learning transformer video-analysis video-representation-learning video-transformer video-understanding vision-transformer

[NeurIPS 2022 Spotlight] VideoMAE:用于自监督视频预训练的数据高效掩码自编码器

项目最后更新:12/08/23

GitHub Stars

1.8K

Forks数量

171

贡献者数量

6

许可证

Other

收录理由

VideoMAE 是 NeurIPS 2022 Spotlight 论文的官方 PyTorch 实现,将掩码自编码器预训练引入视频理解领域,至今仍是动作识别方向的重要参考代码库。如果你正在训练模型来分类或定位视频中的动作,比如体育赛事分析、媒体内容打标等场景,这个仓库展示了一种高效预训练时空视觉 Transformer 的方法,所需标注数据量远小于全监督方案。代码支持多节点分布式训练,附带 Kinetics-400、Something-Something、UCF101 和 HMDB51 的预训练模型与检查点,还提供 Colab 笔记本和 Hugging Face 模型,方便你先快速验证效果再投入重型实验。需要注意的是,这是研究导向的代码,不是开箱即用的产品,使用时需要根据自己的数据集调整配置和数据加载逻辑。对于重视数据效率、想找可靠起点的视频自监督学习团队来说,这份实现很有实际参考价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目