#63 · 主分类: 基础模型

DeepSeek-VL2

DeepSeek-VL2:用于高级多模态理解的混合专家视觉-语言模型

项目最后更新:02/26/25

GitHub Stars

5.4K

Forks数量

1.8K

贡献者数量

10

许可证

MIT

收录理由

DeepSeek-VL2 是一组开源的视觉语言模型,采用混合专家架构设计,1.0B、2.8B 和 4.5B 三个版本在每次请求时只激活一小部分参数。这样一来,计算开销接近小模型,却依然能处理视觉问答、OCR 和物体定位等任务,适合那些想要多模态能力、又不想为稠密大模型付出高昂算力成本的团队。仓库提供了简洁的 Hugging Face 集成,Python 调用路径很短:加载权重,传入一张或几张图片,就能得到文本输出,以及用于 grounding 任务的边界框。对于文档理解、视觉搜索或图像描述这类场景,如果你希望自己运行并微调模型,这是一个很实际的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目