GitHub Stars
848
Forks数量
53
贡献者数量
74
许可证
Apache-2.0
收录理由
OpenRLHF 本身并未原生支持多模态强化学习训练,想在这套框架上做视觉语言模型的规则化 RL,通常得自己拼装一套流程。LMM-R1 补上了这个缺口,它把 OpenRLHF 扩展到可训练 3B 级多模态大模型,采用两阶段方案:先做纯文本推理,再做多模态泛化,并且附带了 VerMulti 数据集和训练脚本,能在本地硬件上复现论文里报告的地理与感知推理效果。该项目的不少代码已经合入 OpenRLHF-M,原本就使用这套栈的团队可以直接采用相关思路,不必长期维护分支。对想把规则化 RL 应用到自定义视觉语言模型的研究者和工程师来说,这里提供的是可直接上手的数据与配置,而不仅仅是论文描述。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。