#36 · 主分类: 深度学习框架
OpenRLHF
一个基于 Ray 的易用、可扩展、高性能智能体 RL 框架(PPO 和 DAPO 和 REINFORCE++ 和 VLM 和 TIS 和 vLLM 和 Ray 和异步 RL)
项目最后更新:08/13/26
GitHub Stars
10.0K
Forks数量
1.0K
贡献者数量
90
许可证
Apache-2.0
收录理由
对于想要用强化学习来对齐模型、而不只是做监督微调的团队,OpenRLHF 提供了一条省去分布式底层搭建的捷径。它把 Ray 的任务调度、vLLM 的推理生成和 DeepSpeed 的显存优化整合在同一套代码路径里,无论是 PPO、GRPO、RLOO、DAPO 还是 REINFORCE++,都能在多卡环境下直接跑大模型,连多模态视觉语言模型也支持。基于智能体的设计还允许构造多轮、与环境交互的训练循环,配合自定义奖励函数,这恰恰是真实 RLHF 项目里最常见的需求。相比只给抽象概念,项目自带大量可运行的示例脚本,覆盖典型场景,小团队也能据此搭出可用流程,不必自己从零推导整套分布式训练栈。需要注意的是,它本质是训练框架而非推理服务,GPU 资源和实验管理方案仍需自己准备。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。