#215 · 主分类: 计算机视觉

eomt

eomt image-segmentation instance-segmentation panoptic-segmentation segmentation transformers vision-transformer vit

[CVPR 2025 Highlight] Encoder-only Mask Transformer (EoMT) 的官方代码和模型。

项目最后更新:07/22/26

GitHub Stars

620

Forks数量

60

贡献者数量

5

许可证

MIT

收录理由

EoMT 是 CVPR 2025 的 Highlight 论文,它重新审视了图像分割到底需要多复杂的网络结构。这个项目直接把一个预训练好的普通 Vision Transformer 拿来用,让图像块和分割查询都作为 token 一起编码,既不加适配器,也不挂解码器。别看结构这么简单,它的精度能逼近那些堆砌了各种任务专用模块的最新方法,而且用 ViT-L 做骨干时速度还能快上 4 倍。仓库里提供了在 COCO、ADE20K 和 Cityscapes 上做全景、实例和语义分割的官方训练与评估代码,还带 DINOv2、DINOv3 骨干的配置和预训练权重模型库。想拿它当轻量基线来对比现有流程的团队会很顺手,配套的 VidEoMT 工作还把同样的极简思路延伸到了视频分割上。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目