#500 · 主分类: 计算机视觉

GFNet

computer-vision deep-learning image-classification image-recognition vision-transformer

[NeurIPS 2021] [T-PAMI] 全局滤波网络用于图像分类

项目最后更新:06/12/23

GitHub Stars

511

Forks数量

47

贡献者数量

3

许可证

MIT

收录理由

主流视觉Transformer常受自注意力二次复杂度拖累,而GFNet走了一条更省的路:把注意力层换成频率域里的全局滤波,借助FFT实现。这样,即便在小规模ViT式网络里处理高分辨率特征图,长距离空间依赖也只需对数线性代价即可覆盖,对算力有限的场景相当实用。仓库提供了从7M参数的tiny版本到54M参数的large版本、在ImageNet上预训练好的权重,每个型号都标了Top-1精度,方便你按自己的计算预算挑选。代码沿用了timm和DeiT的成熟写法,接进现有PyTorch训练流程几乎无摩擦。若你想试一试基于傅里叶的token混合方案,那个GlobalFilter层写得很紧凑,直接拆出来移植到自己的架构里也不费劲。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目