#516 · 主分类: 计算机视觉
ConvMAE
ConvMAE:掩码卷积与掩码自编码器的结合
项目最后更新:03/14/23
GitHub Stars
531
Forks数量
44
贡献者数量
4
许可证
MIT
收录理由
ConvMAE是NeurIPS 2022论文的官方实现,其核心思路是把卷积阶段与Transformer编码器结合起来,在混合多尺度架构上通过重建被掩码的图像块来完成预训练。这种设计让模型学到的层次化特征具备良好的迁移能力,可以直接用于多种下游视觉任务。仓库里提供了ImageNet-1K的预训练与微调脚本,也附带了COCO目标检测、实例分割(基于Mask R-CNN)以及ADE20K语义分割(基于UperNet)的配置,照着跑就能复现论文报告的数字,或者直接拿已发布的预训练权重做自己的实验。需要说明的是,这是一个研究性质的项目,不是开箱即用的产品,配置调整、训练日志排查和GPU资源都得自己动手。不过,如果你正在对比各种自监督视觉预训练方法,能在同一个仓库里把训练和评估的完整流程走通,确实省去不少折腾。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。