#219 · 主分类: 计算机视觉
LISA
large-language-model
llm
multi-modal
segmentation
LISA: 基于大语言模型的推理分割项目页面
项目最后更新:02/16/25
GitHub Stars
2.7K
Forks数量
206
贡献者数量
11
许可证
Apache-2.0
收录理由
LISA将大语言模型对图像的理解能力与像素级分割掩码的生成相结合,当问题涉及世界知识或需要分步推理时,它能用自然语言给出回答,同时精确标出所指的物体区域。这种“边说边指”的方式特别适合那些不仅需要答案、更希望模型明确展示关注区域的场景,比如接地式的视觉问答、辅助检测或巡检工具。项目提供了在线演示和本地部署说明,可以快速上手体验;代码仓库本身也是扎实的参考实现,包含训练流程,并附带LISA++变体,引入了视觉思维链数据,对研究或工程实践都有参考价值。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。