#421 · 主分类: 计算机视觉

GroupViT

image-text-matching semantic-segmentation transformers zero-shot-learning

GroupViT 的官方 PyTorch 实现:语义分割从文本监督中涌现,CVPR 2022。

项目最后更新:05/10/22

GitHub Stars

790

Forks数量

59

贡献者数量

2

许可证

Other

收录理由

GroupViT 解决了一个大多数分割模型都回避的问题:在没有像素级掩码标注的情况下,仅凭图像与文本描述的配对数据,就能学会将视觉上相似的区域归并为语义片段。这一思路正是 CVPR 2022 论文的核心。仓库提供了官方实现、预训练权重以及在 PASCAL VOC 和 COCO 上的评测脚本,复现论文中的零样本结果相当直接。它属于研究型代码库,而非面向生产环境的分割服务。对于研究弱监督或零样本视觉任务的团队来说,仔细研读其层级分组与文本对齐的实现方式,会带来很大启发。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目