#168 · 主分类: 深度学习框架

lmm-r1

扩展OpenRLHF以支持LMM强化学习训练,用于在多模态任务上复现DeepSeek-R1。

项目最后更新:05/14/25

GitHub Stars

848

Forks数量

53

贡献者数量

74

许可证

Apache-2.0

收录理由

OpenRLHF 本身并未原生支持多模态强化学习训练,想在这套框架上做视觉语言模型的规则化 RL,通常得自己拼装一套流程。LMM-R1 补上了这个缺口,它把 OpenRLHF 扩展到可训练 3B 级多模态大模型,采用两阶段方案:先做纯文本推理,再做多模态泛化,并且附带了 VerMulti 数据集和训练脚本,能在本地硬件上复现论文里报告的地理与感知推理效果。该项目的不少代码已经合入 OpenRLHF-M,原本就使用这套栈的团队可以直接采用相关思路,不必长期维护分支。对想把规则化 RL 应用到自定义视觉语言模型的研究者和工程师来说,这里提供的是可直接上手的数据与配置,而不仅仅是论文描述。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目