#100 · 主分类: 计算机视觉

vjepa2

用于视频的VJEPA2自监督学习的PyTorch代码和模型。

项目最后更新:03/23/26

GitHub Stars

4.5K

Forks数量

559

贡献者数量

15

许可证

MIT

收录理由

多数视频模型擅长描述画面里有什么,而V-JEPA 2的目标是理解时间维度上发生了什么。这是Meta FAIR推出的自监督视频编码器,利用互联网规模的无标注视频进行训练,在运动理解和人类动作预测任务上报告了领先的结果。同一代码库还包含V-JEPA 2-AC,这是一个基于少量机器人轨迹数据后训练得到的世界模型,无需针对特定任务训练或校准即可处理操作任务。由于训练过程是自监督的,你可以用自有视频数据对编码器进行适配,无需投入大量标注工作。发布的PyTorch代码和预训练权重开箱可用,省去了自己复现论文的麻烦。2.1版本更新了训练方案,能学习到更密集、时间上更一致的特征。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目