#114 · 主分类: 深度学习框架

Agent-R1

agent agentic-rl llm

Agent-R1:使用端到端强化学习训练强大的LLM智能体

项目最后更新:08/24/26

GitHub Stars

1.6K

Forks数量

114

贡献者数量

7

许可证

MIT

收录理由

Agent-R1 是一个模块化框架,用于通过端到端强化学习训练多步骤 LLM 智能体。它不把每次交互当作一条不断增长的提示-响应序列,而是将每个回合建模为步骤级马尔可夫决策过程转移,让模型在环境中观察、采取行动,并在下一回合前响应工具或环境反馈。这样一来,奖励分配和策略优化在整个轨迹中都保持明确,而不是被压缩进单一上下文窗口。分层抽象允许你在差异很大的任务间复用同一个训练器,仓库中提供了针对 GSM8K、HotpotQA、ALFWorld 和 WebShop 等基准的文档化配方,以及 ModelScope 上的处理数据集,无需自己组装每个组件即可复现训练过程。技术报告和文档详细解释了步骤级表示和上下文管理,如果你想将框架适配到自己的环境,或在不重写整个堆栈的情况下替换训练策略(如 StepPO 或 GRPO),这一点很重要。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目