#21 · 主分类: 基础模型

VLM-R1

deepseek-r1 grpo llm multimodal multimodal-r1 qwen r1-zero reinforcement-learning vlm vlm-r1

强化视觉语言模型解决视觉理解

项目最后更新:07/07/26

GitHub Stars

6.0K

Forks数量

384

贡献者数量

22

许可证

Apache-2.0

收录理由

VLM-R1 把 R1 风格的强化学习流程搬到了视觉语言模型上,并且把训练代码、具体数据集和预训练权重都完整公开了。如果你正在用 GRPO 微调多模态模型,通常得从零散论文里拼凑实操细节,而这个项目基于 Qwen2.5-VL 搭建,脚本和数据都是现成的,可以直接照着跑。它发布的检查点覆盖了指代表达理解、开放词汇检测和视觉数学推理这几类任务,想直接用于这些场景或者研究训练方法都行。README 里还记录了一个有价值的观察:随着训练步数增加,强化学习在域外数据上的泛化表现优于监督微调。项目附带在线演示和技术报告,想尝试在多模态场景下做强化学习的话,这是一个很实在的切入点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目