#657 · 主分类: 教育与研究

VisualThinker-R1-Zero

deepseek deepseek-r1 deepseek-r1-zero grpo multimodal multimodal-journey multimodal-r1 post-training r1 r1-zero reasoning reinforcement-learning

探索2B模型上的多模态“啊哈时刻”

项目最后更新:03/18/25

GitHub Stars

623

Forks数量

23

贡献者数量

3

许可证

Other

收录理由

这个仓库记录了一项研究复现工作,把DeepSeek-R1-Zero的强化学习训练方法应用到一个较小的视觉语言模型上。作者用GRPO算法训练了2B参数的Qwen2-VL模型,全程没有做监督微调,结果观察到模型在视觉推理任务中出现了和纯文本版R1-Zero类似的自我反思行为,回答长度会随训练逐步增加,甚至出现了那种模型自己发现错误、主动修正的“顿悟时刻”。对研究多模态推理的学者和学生来说,这份材料很有参考价值,尤其是想了解推理能力如何在强化学习后训练阶段自然涌现的人。作者还在Hugging Face上放出了模型检查点,想复现或扩展这套训练流程的话,可以直接拿它当起点。整体上属于研究性质的项目,不是面向生产环境的工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目