#446 · 主分类: 计算机视觉

CvT

classification computer-vision cvt deep-learning imagenet

这是CvT的官方实现:将卷积引入视觉Transformer。

项目最后更新:05/16/23

GitHub Stars

606

Forks数量

129

贡献者数量

5

许可证

MIT

收录理由

CvT 是微软官方发布的视觉 Transformer 实现,其核心思路是把卷积操作融入标准的 ViT 架构,从而在保留 Transformer 全局注意力优势的同时,获得卷积神经网络对平移、缩放和形变的鲁棒性。论文中的关键结论是,这种混合设计在 ImageNet-1k 上以更少的参数和计算量超越了纯 ViT 和 ResNet,而仓库中恰好提供了复现这些结果所需的完整训练与评估代码,配置通过 YAML 文件组织,并附带了运行脚本。项目还给出了 CvT-13、CvT-21 和 CvT-W24 的预训练权重,你可以直接下载来复现论文数据,或者基于这些权重在自己的数据集上微调,省去从零实现的麻烦。需要注意的是,这是一个研究型代码库,并非开箱即用的 pip 包,使用时需要直接操作 PyTorch,并根据自身环境调整训练流程。如果你正在比较高效的视觉骨干网络,或者想为分类实验找一个可靠的起点,这些预训练模型和清晰的实验结构值得参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目