#21 · 主分类: 基础模型
VLM-R1
deepseek-r1
grpo
llm
multimodal
multimodal-r1
qwen
r1-zero
reinforcement-learning
vlm
vlm-r1
强化视觉语言模型解决视觉理解
项目最后更新:07/07/26
GitHub Stars
6.0K
Forks数量
384
贡献者数量
22
许可证
Apache-2.0
收录理由
VLM-R1 把 R1 风格的强化学习流程搬到了视觉语言模型上,并且把训练代码、具体数据集和预训练权重都完整公开了。如果你正在用 GRPO 微调多模态模型,通常得从零散论文里拼凑实操细节,而这个项目基于 Qwen2.5-VL 搭建,脚本和数据都是现成的,可以直接照着跑。它发布的检查点覆盖了指代表达理解、开放词汇检测和视觉数学推理这几类任务,想直接用于这些场景或者研究训练方法都行。README 里还记录了一个有价值的观察:随着训练步数增加,强化学习在域外数据上的泛化表现优于监督微调。项目附带在线演示和技术报告,想尝试在多模态场景下做强化学习的话,这是一个很实在的切入点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。