#20 · 主分类: 计算机视觉
vit-pytorch
Vision Transformer的实现,一种仅使用单个transformer编码器即可在视觉分类中达到SOTA的简单方法,基于Pytorch。
项目最后更新:08/27/26
GitHub Stars
25.5K
Forks数量
3.5K
贡献者数量
28
许可证
MIT
收录理由
这个仓库在PyTorch社区里几乎是Vision Transformer的代名词,它用单个Transformer编码器就实现了图像分类,完全不需要卷积骨干网络,当初这篇论文就是这么简单直接。不过它真正的价值在于覆盖面:除了基础的ViT,还收录了SimpleViT、CaiT、CvT、MobileViT、MaxViT、XCiT以及掩码自编码器预训练等一系列后续变体,代码干净、依赖少,想对比不同架构时不用自己重写每篇论文的实现。每个变体都是一个小而可读的类,附有简短的使用示例,很适合用来快速原型验证,或者搞清楚这些模型内部到底是怎么连线的。它更偏向研究工具,而不是现成的模型库,权重和训练循环都得自己准备,想要预训练权重的话,可以搭配timm这类项目一起用。如果你正在探索基于Transformer的视觉方案,或者想搭一条自定义的分类流程,从这里入手能很快把想法跑起来。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。