#117 · 主分类: 基础模型

Groma

foundation-models grounding large-language-models llama llama2 llm mllm multimodal vision-language-model

[ECCV2024] 基于局部视觉标记化的多模态大语言模型

项目最后更新:06/07/24

GitHub Stars

586

Forks数量

44

贡献者数量

4

许可证

Apache-2.0

收录理由

Groma 是一个面向研究场景的多模态大语言模型,其核心思路是用局部化的视觉分词器,让模型在回答时能精确对应到图像中的具体区域。它既支持用户用框选方式指定感兴趣的区域作为输入,也能生成长篇回复,并且这些回复会自然地关联回视觉上下文。在指代表达理解(REC)这类基准上,Groma 报告了当前领先的结果。仓库里提供了完整的训练流程、预训练权重,以及一个用 GPT-4V 构建的带 grounding 的对话数据集。代码基于 LLaVA 和 GPT4ROI 搭建,如果你熟悉这两套框架,上手会比较容易;推理脚本还支持 fp16、8-bit 和 4-bit 量化,在显存有限的机器上也能跑起来。需要说明的是,这更像一个研究原型而非开箱即用的产品,实际使用时通常需要根据自己的数据调整训练和评估代码。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目