#36 · 主分类: 深度学习框架

OpenRLHF

large-language-models proximal-policy-optimization raylib reinforcement-learning reinforcement-learning-from-human-feedback transformers visual-language-models vllm

一个基于 Ray 的易用、可扩展、高性能智能体 RL 框架(PPO 和 DAPO 和 REINFORCE++ 和 VLM 和 TIS 和 vLLM 和 Ray 和异步 RL)

项目最后更新:08/13/26

GitHub Stars

10.0K

Forks数量

1.0K

贡献者数量

90

许可证

Apache-2.0

收录理由

对于想要用强化学习来对齐模型、而不只是做监督微调的团队,OpenRLHF 提供了一条省去分布式底层搭建的捷径。它把 Ray 的任务调度、vLLM 的推理生成和 DeepSpeed 的显存优化整合在同一套代码路径里,无论是 PPO、GRPO、RLOO、DAPO 还是 REINFORCE++,都能在多卡环境下直接跑大模型,连多模态视觉语言模型也支持。基于智能体的设计还允许构造多轮、与环境交互的训练循环,配合自定义奖励函数,这恰恰是真实 RLHF 项目里最常见的需求。相比只给抽象概念,项目自带大量可运行的示例脚本,覆盖典型场景,小团队也能据此搭出可用流程,不必自己从零推导整套分布式训练栈。需要注意的是,它本质是训练框架而非推理服务,GPU 资源和实验管理方案仍需自己准备。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目