#420 · 主分类: 计算机视觉

DynamicViT

computer-vision deep-learning image-classification vision-transformers

[NeurIPS 2021] [T-PAMI] DynamicViT:基于动态令牌稀疏化的高效视觉Transformer

项目最后更新:07/11/23

GitHub Stars

668

Forks数量

80

贡献者数量

6

许可证

MIT

收录理由

视觉Transformer在推理时计算开销很大,DynamicViT的思路是让网络在逐层前传过程中学会丢弃那些冗余的图像块,只保留对当前输入真正有用的部分,从而让后续层专注于关键信息。作者给出的实验数据显示,这种方法能在精度损失不超过0.5%的前提下,减少超过30%的FLOPs,并提升40%以上的吞吐量。仓库里提供了基于DeiT和LVViT骨干在ImageNet上预训练好的模型权重,可以直接下载使用。论文的T-PAMI扩展版还把同样的动态空间稀疏化思路推广到了ConvNeXt、Swin Transformer等架构,以及目标检测和语义分割任务上。需要留意的是,这是研究性质的代码,不是开箱即用的库,想用到自己的流程里得自己调整训练脚本。如果你在关注高效视觉骨干网络,或者想基于token稀疏化做进一步探索,这份PyTorch实现是个不错的参考起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目