#247 · 主分类: 计算机视觉

cambrian-s

computer-vision llm multimodal-large-language-models spatial-understanding vision-language-model

Cambrian-S:迈向视频中的空间超感知

项目最后更新:04/03/26

GitHub Stars

568

Forks数量

20

贡献者数量

3

许可证

Apache-2.0

收录理由

Cambrian-S 是一组面向视频空间推理的视觉语言模型,通用多模态大模型在这个任务上往往力不从心,而它专门补上了这块短板。仓库提供了从 0.5B 到 7B 参数的预训练权重,连同训练代码和评测工具一起放出,你可以直接跑现成模型,也可以照着训练流程自己复现或改动。项目还公开了 VSI-590K 指令微调数据集和 VSI-SUPER 基准,想自己微调一个视频空间理解模型,或者拿专用测试集给模型打分,这些资源都能派上用场。做视频理解或具身感知的团队,可以直接拿权重和评测框架来适配;研究者也能基于这套可复现的训练栈继续往下做。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目