#89 · 主分类: 基础模型
DeepSeek-VL
foundation-models
vision-language-model
vision-language-pretraining
DeepSeek-VL:迈向真实世界的视觉-语言理解
项目最后更新:04/24/24
GitHub Stars
4.2K
Forks数量
597
贡献者数量
7
许可证
MIT
收录理由
DeepSeek-VL 是一个开源的视觉语言模型,你可以直接下载、运行甚至自行微调,而不必依赖 API 调用。它把混合视觉编码器与 DeepSeek 语言主干结合起来,设计上很贴近实际应用:在固定 token 预算内接受 1024×1024 的图片,训练数据覆盖网页截图、PDF、OCR 结果、图表和教科书。因此,它在文档理解、公式与图表识别、以及图像问答等场景中表现实用。项目同时提供 1.3B 和 7B 两个规模的权重,小团队可以先从轻量版本入手,后续再升级。仓库里附有模型下载指引、快速上手教程和在线演示,方便你在投入更大部署之前先体验效果。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。