#151 · 主分类: 计算机视觉

Sa2VA

computer-vision large-language-models mllm

Pixel-LLM 代码库官方仓库:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA(LSVOS 第一名解决方案)

项目最后更新:08/04/26

GitHub Stars

1.7K

Forks数量

131

贡献者数量

9

许可证

Apache-2.0

收录理由

Sa2VA把SAM-2分割模型与多模态大语言模型融为一个整体,让同一套模型既能对话图像和视频,也能直接输出像素级掩码,覆盖指代分割、接地对话、视觉提示与多模态聊天等任务。仓库里还附带了好几个配套项目:VRT在Sa2VA基础上做物体级接地推理,自带评测基准和训练数据;SAMTok把掩码变成统一令牌接口,其他多模态大模型也能理解和生成掩码;SaSaSa2VA是分割增强版本,在ICCV 2025 LSVOS挑战赛中获得第一名。模型支持InternVL2.5/3与Qwen2.5/3-VL等多种骨干网络,权重可从Hugging Face下载,还有Gradio演示可以先行体验。如果你在做标注工具、视频理解或可提示分割系统,这个项目提供了扎实的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目