#23 · 主分类: 基础模型
InternVL
gpt
gpt-4o
gpt-4v
image-classification
image-text-retrieval
llm
multi-modal
semantic-segmentation
video-classification
vision-language-model
vit-22b
vit-6b
接近GPT-4o表现的开源多模态对话模型
项目最后更新:09/22/25
GitHub Stars
10.1K
Forks数量
793
贡献者数量
19
许可证
MIT
收录理由
InternVL 是一系列开放的多模态视觉语言模型,目标是在图像理解和推理质量上达到以往只有付费商业服务才能提供的水平。对于希望自己部署多模态模型而不是按 token 付费调用厂商 API 的团队,可以从 1B 到 8B 的紧凑版本一直选到面向高负载场景的超大规模版本,按自身硬件条件灵活选择。这些模型覆盖了视觉问答、文档与图表理解、图像描述、视频和分割等任务,往往能直接作为产品开发的可靠起点,而不是一个黑盒。项目还公开了训练报告以及构建和准备数据所用的代码,工程师可以针对自身领域进行微调,研究者也能深入研究方法细节而无需猜测。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。