#219 · 主分类: 计算机视觉

LISA

large-language-model llm multi-modal segmentation

LISA: 基于大语言模型的推理分割项目页面

项目最后更新:02/16/25

GitHub Stars

2.7K

Forks数量

206

贡献者数量

11

许可证

Apache-2.0

收录理由

LISA将大语言模型对图像的理解能力与像素级分割掩码的生成相结合,当问题涉及世界知识或需要分步推理时,它能用自然语言给出回答,同时精确标出所指的物体区域。这种“边说边指”的方式特别适合那些不仅需要答案、更希望模型明确展示关注区域的场景,比如接地式的视觉问答、辅助检测或巡检工具。项目提供了在线演示和本地部署说明,可以快速上手体验;代码仓库本身也是扎实的参考实现,包含训练流程,并附带LISA++变体,引入了视觉思维链数据,对研究或工程实践都有参考价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目