#58 · 主分类: 基础模型

cambrian

chatbot clip computer-vision dino instruction-tuning large-language-models llms mllm multimodal-large-language-models representation-learning

Cambrian-1 是一系列多模态LLM,采用以视觉为中心的设计。

项目最后更新:11/07/25

GitHub Stars

2.0K

Forks数量

140

贡献者数量

4

许可证

Apache-2.0

收录理由

Cambrian-1 适合那些正在构建视觉语言助手、并且希望整个技术栈完全开放而不依赖托管 API 的开发者。这个项目把重心放在视觉一侧:它没有直接把通用的视觉嵌入喂给语言模型,而是训练了多个视觉编码器,再以视觉优先的方式把它们接入语言主干。代码仓库里不光有模型权重,还提供了训练和微调的完整代码,同时发布了包含 1000 万张图像的数据集,以及用于检验视觉 grounding 能力的 CV-Bench 基准。这是一套研究性质的软件,需要你自己用 PyTorch 跑起来,所以它更适合那些想要复现论文结果、或者打算用自己的数据重新训练一个开源多模态基线的团队。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目