#151 · 主分类: 计算机视觉
Sa2VA
Pixel-LLM 代码库官方仓库:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA(LSVOS 第一名解决方案)
项目最后更新:08/04/26
GitHub Stars
1.7K
Forks数量
131
贡献者数量
9
许可证
Apache-2.0
收录理由
Sa2VA把SAM-2分割模型与多模态大语言模型融为一个整体,让同一套模型既能对话图像和视频,也能直接输出像素级掩码,覆盖指代分割、接地对话、视觉提示与多模态聊天等任务。仓库里还附带了好几个配套项目:VRT在Sa2VA基础上做物体级接地推理,自带评测基准和训练数据;SAMTok把掩码变成统一令牌接口,其他多模态大模型也能理解和生成掩码;SaSaSa2VA是分割增强版本,在ICCV 2025 LSVOS挑战赛中获得第一名。模型支持InternVL2.5/3与Qwen2.5/3-VL等多种骨干网络,权重可从Hugging Face下载,还有Gradio演示可以先行体验。如果你在做标注工具、视频理解或可提示分割系统,这个项目提供了扎实的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。