#250 · 主分类: 计算机视觉
Seg-Zero
Seg-Zero:通过认知强化引导的分割推理链项目页面
项目最后更新:01/17/26
GitHub Stars
639
Forks数量
30
贡献者数量
1
许可证
Apache-2.0
收录理由
Seg-Zero 是一套面向视觉语言模型的研究代码,核心思路是让模型在生成分割掩码之前,先输出一段推理链,明确“该先看哪里、找什么”,再据此完成图像分割。整个训练过程完全依赖强化学习,用 IoU 和 L1 奖励引导模型学会推理,不引入任何显式的监督推理数据。如果你在做指代表达分割或视觉定位,仓库里放出的 7B 权重和基于 RefCOCOg 整理出的训练数据,可以直接作为实验起点。代码基于 EasyR1 和 veRL 搭建,支持 Qwen2-VL 与 Qwen2.5-VL 系列模型,并已实现常用的目标检测与分割奖励函数,还附带推理、评估脚本以及面向多卡环境的 GRPO 训练流程。需要说明的是,这是研究型工具而非开箱即用的产品,实际使用时往往要针对自己的数据和硬件条件调整管线。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。