#461 · 主分类: 计算机视觉

BiFormer

attention computer-vision cvpr2023 image-classification object-detection semantic-segmentation transformer

[CVPR 2023] 论文“BiFormer: Vision Transformer with Bi-Level Routing Attention”的官方代码发布

项目最后更新:05/22/23

GitHub Stars

583

Forks数量

41

贡献者数量

1

许可证

MIT

收录理由

BiFormer 是 CVPR 2023 上提出的视觉 Transformer 模型,核心思路是双层路由注意力:模型先快速锁定图像中少数几个相关区域,再只在这些区域内做注意力计算。相比全局注意力,这种设计在保持精度的同时明显减少了计算量,因此常被用来搭建高效的骨干网络。仓库提供了多种尺寸的 ImageNet-1K 预训练权重,以及目标检测和语义分割的可用代码,方便直接接入下游任务,不必从头实现。项目基于 timm 构建,并给出了在 Slurm 集群和单机上的训练与评估说明。需要留意的是,这更像一份研究代码而非长期维护的库,用于生产环境时可能要自行调整;不过其中的注意力模块对定制视觉模型来说是个不错的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目