#89 · 主分类: 基础模型

DeepSeek-VL

foundation-models vision-language-model vision-language-pretraining

DeepSeek-VL:迈向真实世界的视觉-语言理解

项目最后更新:04/24/24

GitHub Stars

4.2K

Forks数量

597

贡献者数量

7

许可证

MIT

收录理由

DeepSeek-VL 是一个开源的视觉语言模型,你可以直接下载、运行甚至自行微调,而不必依赖 API 调用。它把混合视觉编码器与 DeepSeek 语言主干结合起来,设计上很贴近实际应用:在固定 token 预算内接受 1024×1024 的图片,训练数据覆盖网页截图、PDF、OCR 结果、图表和教科书。因此,它在文档理解、公式与图表识别、以及图像问答等场景中表现实用。项目同时提供 1.3B 和 7B 两个规模的权重,小团队可以先从轻量版本入手,后续再升级。仓库里附有模型下载指引、快速上手教程和在线演示,方便你在投入更大部署之前先体验效果。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目