#421 · 主分类: 计算机视觉
GroupViT
image-text-matching
semantic-segmentation
transformers
zero-shot-learning
GroupViT 的官方 PyTorch 实现:语义分割从文本监督中涌现,CVPR 2022。
项目最后更新:05/10/22
GitHub Stars
790
Forks数量
59
贡献者数量
2
许可证
Other
收录理由
GroupViT 解决了一个大多数分割模型都回避的问题:在没有像素级掩码标注的情况下,仅凭图像与文本描述的配对数据,就能学会将视觉上相似的区域归并为语义片段。这一思路正是 CVPR 2022 论文的核心。仓库提供了官方实现、预训练权重以及在 PASCAL VOC 和 COCO 上的评测脚本,复现论文中的零样本结果相当直接。它属于研究型代码库,而非面向生产环境的分割服务。对于研究弱监督或零样本视觉任务的团队来说,仔细研读其层级分组与文本对齐的实现方式,会带来很大启发。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。