#364 · 主分类: 计算机视觉
EVF-SAM
multimodal
multimodal-large-language-models
referring-image-segmentation
segment-anything
segmentation
“EVF-SAM:用于文本提示分割任意模型的早期视觉-语言融合”的官方代码
项目最后更新:03/17/25
GitHub Stars
507
Forks数量
26
贡献者数量
4
许可证
Apache-2.0
收录理由
这是一份可靠的参考实现,适合想通过自然语言描述目标、而不是用点击或画框来分割图像的团队。它的做法是在视觉-语言编码器早期就融合图像与文本,把结果直接送入SAM的提示接口,绕开了常见的先让大语言模型生成候选框再处理的流程。这样一来模型相对轻量,运行也快,仓库里提到在T4 GPU上处理单张图片只需几秒。权重、Colab笔记本和Hugging Face演示都已放出,你可以在RefCOCO这类指代表达基准上做自己的对比,几乎不用额外配置。基于SAM-2的零样本视频分割演示也值得一试,如果项目需要在帧间跟踪目标的话。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。