#92 · 主分类: 深度学习框架

RAGEN

agent-rl agentic-ai llm-agents multi-turn-rl reinforcement-learning rl-framework

面向LLM智能体的强化学习框架:支持多轮强化学习(StarPO)和推理崩溃诊断

项目最后更新:08/23/26

GitHub Stars

2.8K

Forks数量

228

贡献者数量

24

许可证

MIT

收录理由

RAGEN 面向那些自己用强化学习训练 LLM 推理代理、并且想弄清楚训练为何漂移或崩溃、而不是只看着它发生的团队。它没有直接丢给你一个裸的 PPO 或 GRPO 循环,而是把代理强化学习当作一个诊断问题来处理:StarPO 框架优化多轮、轨迹级别的行为,内置的诊断工具会追踪熵和互信息代理指标,以此捕捉普通熵指标发现不了的模板崩溃。项目自带十个现成环境,包括 Sokoban、WebShop、SearchQA 和 Lean,你可以很快在熟悉的任务上做基准测试;同时它兼容 gym 接口,接入你自己的环境也很直接。RAGEN-2 新增的干预手段,比如按奖励方差丢弃噪声 rollouts 的 SNR 自适应过滤,属于那种不需要大改动就能稳定长训练过程的轻量方法。对于想真正理解代理训练、而不是碰运气的研究者和工程师来说,这是一个很实用的入手点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目