#420 · 主分类: 计算机视觉
DynamicViT
[NeurIPS 2021] [T-PAMI] DynamicViT:基于动态令牌稀疏化的高效视觉Transformer
项目最后更新:07/11/23
GitHub Stars
668
Forks数量
80
贡献者数量
6
许可证
MIT
收录理由
视觉Transformer在推理时计算开销很大,DynamicViT的思路是让网络在逐层前传过程中学会丢弃那些冗余的图像块,只保留对当前输入真正有用的部分,从而让后续层专注于关键信息。作者给出的实验数据显示,这种方法能在精度损失不超过0.5%的前提下,减少超过30%的FLOPs,并提升40%以上的吞吐量。仓库里提供了基于DeiT和LVViT骨干在ImageNet上预训练好的模型权重,可以直接下载使用。论文的T-PAMI扩展版还把同样的动态空间稀疏化思路推广到了ConvNeXt、Swin Transformer等架构,以及目标检测和语义分割任务上。需要留意的是,这是研究性质的代码,不是开箱即用的库,想用到自己的流程里得自己调整训练脚本。如果你在关注高效视觉骨干网络,或者想基于token稀疏化做进一步探索,这份PyTorch实现是个不错的参考起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。