#58 · 主分类: 基础模型
cambrian
chatbot
clip
computer-vision
dino
instruction-tuning
large-language-models
llms
mllm
multimodal-large-language-models
representation-learning
Cambrian-1 是一系列多模态LLM,采用以视觉为中心的设计。
项目最后更新:11/07/25
GitHub Stars
2.0K
Forks数量
140
贡献者数量
4
许可证
Apache-2.0
收录理由
Cambrian-1 适合那些正在构建视觉语言助手、并且希望整个技术栈完全开放而不依赖托管 API 的开发者。这个项目把重心放在视觉一侧:它没有直接把通用的视觉嵌入喂给语言模型,而是训练了多个视觉编码器,再以视觉优先的方式把它们接入语言主干。代码仓库里不光有模型权重,还提供了训练和微调的完整代码,同时发布了包含 1000 万张图像的数据集,以及用于检验视觉 grounding 能力的 CV-Bench 基准。这是一套研究性质的软件,需要你自己用 PyTorch 跑起来,所以它更适合那些想要复现论文结果、或者打算用自己的数据重新训练一个开源多模态基线的团队。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。