#993 · 主分类: AI代理与自动化

LLaVA-Plus-Codebase

agent large-language-models large-multimodal-models multimodal-large-language-models tool-use

LLaVA-Plus:可插拔并学习使用技能的大型语言与视觉助手

项目最后更新:02/01/24

GitHub Stars

770

Forks数量

61

贡献者数量

40

许可证

Apache-2.0

收录理由

LLaVA-Plus 是一个多模态大模型的研究代码库,其核心思路不是让模型独自处理所有图像任务,而是学会调用外部视觉工具。面对图像和用户指令时,模型会从技能库中挑选合适的工具,生成对应的提示词,再把工具返回的结果整合进最终回答。对于正在构建工具型多模态智能体的团队来说,训练数据流水线尤其有参考价值——它专门整理了用于工具调用的指令跟随样本。仓库里提供了安装与训练脚本、评估代码和演示,不过部分发布内容仍在完善中。需要留意的是,数据集和模型权重仅限研究用途,因此更适合作为设计参考,而非直接上线的生产服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目