#92 · 主分类: 深度学习框架
RAGEN
面向LLM智能体的强化学习框架:支持多轮强化学习(StarPO)和推理崩溃诊断
项目最后更新:08/23/26
GitHub Stars
2.8K
Forks数量
228
贡献者数量
24
许可证
MIT
收录理由
RAGEN 面向那些自己用强化学习训练 LLM 推理代理、并且想弄清楚训练为何漂移或崩溃、而不是只看着它发生的团队。它没有直接丢给你一个裸的 PPO 或 GRPO 循环,而是把代理强化学习当作一个诊断问题来处理:StarPO 框架优化多轮、轨迹级别的行为,内置的诊断工具会追踪熵和互信息代理指标,以此捕捉普通熵指标发现不了的模板崩溃。项目自带十个现成环境,包括 Sokoban、WebShop、SearchQA 和 Lean,你可以很快在熟悉的任务上做基准测试;同时它兼容 gym 接口,接入你自己的环境也很直接。RAGEN-2 新增的干预手段,比如按奖励方差丢弃噪声 rollouts 的 SNR 自适应过滤,属于那种不需要大改动就能稳定长训练过程的轻量方法。对于想真正理解代理训练、而不是碰运气的研究者和工程师来说,这是一个很实用的入手点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。