#387 · 主分类: 计算机视觉

YOLOS

computer-vision object-detection transformer vision-transformer

[NeurIPS 2021] 你只看一个序列

项目最后更新:05/04/22

GitHub Stars

901

Forks数量

125

贡献者数量

4

许可证

MIT

收录理由

YOLOS 是一个精炼的研究代码库,它展示了纯粹基于 Vision Transformer 的结构在目标检测任务上能走多远。它没有堆叠卷积特征金字塔和任务专用头,而是把检测看作一个序列问题:图像patch直接输入未修改的ViT骨干网络,模型学会输出检测token。仓库提供了预训练权重和一个注意力可视化notebook,因此复现NeurIPS 2021论文的结果,或者把这种纯transformer检测器与后来出现的混合设计做对比,都比较直接。另外,该模型已集成到Hugging Face Transformers中,无需自行编译源码即可加载运行。对于那些好奇纯transformer架构能否替代传统检测骨干的人来说,这是一个很好的基准参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目