#11 · 主分类: 基础模型

LLaVA

chatbot chatgpt foundation-models gpt-4 instruction-tuning llama llama-2 llama2 llava multi-modality multimodal vision-language-model visual-language-learning

[NeurIPS'23 Oral] 视觉指令调优(LLaVA),旨在达到并超越GPT-4V级别的能力。

项目最后更新:08/12/24

GitHub Stars

25.0K

Forks数量

2.8K

贡献者数量

48

许可证

Apache-2.0

收录理由

LLaVA 是视觉指令微调这一方法的参考实现,它让语言模型真正具备了看图与推理的能力。这项工作在 NeurIPS 2023 上以 Oral 论文形式亮相,其简洁的架构和公开的数据集,为后来众多多模态模型奠定了基石。如果你正在开发需要理解截图、照片、图表或文档的应用,这个仓库提供了完整的训练方案、数据处理流程和模型权重,你可以直接在此基础上微调自己的视觉语言助手,而不必从零开始。项目还附带模型动物园和在线演示,在投入训练之前,你可以先用现成的检查点在自己的任务上试跑。对于想找一个成熟、文档完善的多模态理解起点的团队来说,这份代码是值得学习和进一步开发的范本。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目