#461 · 主分类: 计算机视觉
BiFormer
[CVPR 2023] 论文“BiFormer: Vision Transformer with Bi-Level Routing Attention”的官方代码发布
项目最后更新:05/22/23
GitHub Stars
583
Forks数量
41
贡献者数量
1
许可证
MIT
收录理由
BiFormer 是 CVPR 2023 上提出的视觉 Transformer 模型,核心思路是双层路由注意力:模型先快速锁定图像中少数几个相关区域,再只在这些区域内做注意力计算。相比全局注意力,这种设计在保持精度的同时明显减少了计算量,因此常被用来搭建高效的骨干网络。仓库提供了多种尺寸的 ImageNet-1K 预训练权重,以及目标检测和语义分割的可用代码,方便直接接入下游任务,不必从头实现。项目基于 timm 构建,并给出了在 Slurm 集群和单机上的训练与评估说明。需要留意的是,这更像一份研究代码而非长期维护的库,用于生产环境时可能要自行调整;不过其中的注意力模块对定制视觉模型来说是个不错的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。