GitHub Stars
1.9K
Forks数量
116
贡献者数量
8
许可证
Apache-2.0
收录理由
如果你正在训练开源权重模型,希望让它的推理能力超越单纯监督微调所能达到的上限,PRIME提供的不只是一篇论文的摘要,而是一套可以直接上手的完整方案。它实现了Process Reinforcement through Implicit Rewards,一种在线强化学习方法,无需人工标注的过程标签,就能对解题的每一步给予奖励。仓库里包含了训练、评估、数据预处理的全部代码,而且这套方法已经集成进veRL框架,意味着你不需要从头实现一遍,就能从设计直接进入实际运行。已发布的模型权重和数据集既能复现论文中的结果,也方便你针对自己的基座模型做调整。对于想在不依赖模仿或蒸馏的情况下获得推理能力提升的研究者和应用型强化学习工程师来说,这个项目提供了非常实在的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。