GitHub Stars
5.4K
Forks数量
1.8K
贡献者数量
10
许可证
MIT
收录理由
DeepSeek-VL2 是一组开源的视觉语言模型,采用混合专家架构设计,1.0B、2.8B 和 4.5B 三个版本在每次请求时只激活一小部分参数。这样一来,计算开销接近小模型,却依然能处理视觉问答、OCR 和物体定位等任务,适合那些想要多模态能力、又不想为稠密大模型付出高昂算力成本的团队。仓库提供了简洁的 Hugging Face 集成,Python 调用路径很短:加载权重,传入一张或几张图片,就能得到文本输出,以及用于 grounding 任务的边界框。对于文档理解、视觉搜索或图像描述这类场景,如果你希望自己运行并微调模型,这是一个很实际的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。