#324 · 主分类: 计算机视觉

GPT4RoI

computer-vision gpt llm multimodality roi

(ECCVW 2025)GPT4RoI:在感兴趣区域上对大型语言模型进行指令微调

项目最后更新:06/03/25

GitHub Stars

556

Forks数量

28

贡献者数量

3

许可证

Other

收录理由

GPT4RoI 是一套面向区域级图像理解的研究代码库,核心思路是对大语言模型做指令微调,让模型不再只描述整张图,而是能针对用户圈定的某个具体区域,回答关于该区域的问题。这种能力直接对应视觉定位和细粒度视觉问答等任务,对相关方向的研究者很有参考价值。仓库里完整提供了训练和推理流程,还附带 Gradio 演示,方便快速上手体验。如果你想了解如何在多模态骨干网络上搭建区域条件指令微调,这套代码是一个不错的起点。项目还发布了 delta 权重,配合原始 LLaMA 权重即可还原模型,不必从头训练。需要留意的是,代码采用非商用许可,更适合作为学术研究材料,不建议直接用于产品部署。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目