GitHub Stars
4.1K
Forks数量
419
贡献者数量
5
许可证
Other
收录理由
Meta FAIR 官方发布的 V-JEPA 代码库,核心思路是让模型通过观看无标注视频来学习视觉表征。它不走像素重建的老路,而是在潜在空间里预测视频中缺失的时空区域,训练过程完全不依赖文本、人工标注、负样本或像素级重构。训练好的 ViT 骨干网络可以直接冻结使用,迁移到视频和图像两类任务上,配上轻量级的 attentive probe,在 Kinetics-400、Something-Something-v2 和 ImageNet 上都能拿到不错的结果。如果你的工作涉及标注数据稀缺的视频理解,仓库里附带的 ViT-Large 和 ViT-Huge 预训练权重以及评估脚本可以省去不少从头训练的功夫。整体是面向研究复现的工程实现,采用配置驱动的 PyTorch 训练流程,数据以 CSV 格式组织,并非开箱即用的推理服务。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。