#364 · 主分类: 计算机视觉

EVF-SAM

multimodal multimodal-large-language-models referring-image-segmentation segment-anything segmentation

“EVF-SAM:用于文本提示分割任意模型的早期视觉-语言融合”的官方代码

项目最后更新:03/17/25

GitHub Stars

507

Forks数量

26

贡献者数量

4

许可证

Apache-2.0

收录理由

这是一份可靠的参考实现,适合想通过自然语言描述目标、而不是用点击或画框来分割图像的团队。它的做法是在视觉-语言编码器早期就融合图像与文本,把结果直接送入SAM的提示接口,绕开了常见的先让大语言模型生成候选框再处理的流程。这样一来模型相对轻量,运行也快,仓库里提到在T4 GPU上处理单张图片只需几秒。权重、Colab笔记本和Hugging Face演示都已放出,你可以在RefCOCO这类指代表达基准上做自己的对比,几乎不用额外配置。基于SAM-2的零样本视频分割演示也值得一试,如果项目需要在帧间跟踪目标的话。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目