#194 · 主分类: 计算机视觉

jepa

用于从视频中进行V-JEPA自监督学习的PyTorch代码和模型。

项目最后更新:02/27/25

GitHub Stars

4.1K

Forks数量

419

贡献者数量

5

许可证

Other

收录理由

Meta FAIR 官方发布的 V-JEPA 代码库,核心思路是让模型通过观看无标注视频来学习视觉表征。它不走像素重建的老路,而是在潜在空间里预测视频中缺失的时空区域,训练过程完全不依赖文本、人工标注、负样本或像素级重构。训练好的 ViT 骨干网络可以直接冻结使用,迁移到视频和图像两类任务上,配上轻量级的 attentive probe,在 Kinetics-400、Something-Something-v2 和 ImageNet 上都能拿到不错的结果。如果你的工作涉及标注数据稀缺的视频理解,仓库里附带的 ViT-Large 和 ViT-Huge 预训练权重以及评估脚本可以省去不少从头训练的功夫。整体是面向研究复现的工程实现,采用配置驱动的 PyTorch 训练流程,数据以 CSV 格式组织,并非开箱即用的推理服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目