#11 · 主分类: 基础模型
LLaVA
[NeurIPS'23 Oral] 视觉指令调优(LLaVA),旨在达到并超越GPT-4V级别的能力。
项目最后更新:08/12/24
GitHub Stars
25.0K
Forks数量
2.8K
贡献者数量
48
许可证
Apache-2.0
收录理由
LLaVA 是视觉指令微调这一方法的参考实现,它让语言模型真正具备了看图与推理的能力。这项工作在 NeurIPS 2023 上以 Oral 论文形式亮相,其简洁的架构和公开的数据集,为后来众多多模态模型奠定了基石。如果你正在开发需要理解截图、照片、图表或文档的应用,这个仓库提供了完整的训练方案、数据处理流程和模型权重,你可以直接在此基础上微调自己的视觉语言助手,而不必从零开始。项目还附带模型动物园和在线演示,在投入训练之前,你可以先用现成的检查点在自己的任务上试跑。对于想找一个成熟、文档完善的多模态理解起点的团队来说,这份代码是值得学习和进一步开发的范本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。