#689 · 主分类: AI代理与自动化

OpenClaw-RL

async coding grpo gui-application memory-systems on-policy-distillation open-claw openclaw-skills rlhf sglang skill-learning slime tinker

OpenClaw-RL:只需对话即可训练任何智能体

项目最后更新:05/23/26

GitHub Stars

5.7K

Forks数量

609

贡献者数量

11

许可证

Apache-2.0

收录理由

OpenClaw-RL 面向自己运行助手或编码代理的用户,让代理能从真实使用中持续学习,而不是停留在初始状态。它作为一个兼容 OpenAI 的 API 层放在已部署模型之前,观察实时的多轮对话,并把每次行动后的反馈信号——比如用户的再次查询、工具返回结果、失败的测试——转化为训练梯度。回滚收集、奖励评估和策略更新各自在独立的异步循环中运行,代理一边继续正常应答,优化在后台进行,全部在自己硬件上完成,不需要人工标注。训练方式上可以选择标量过程奖励、基于事后指导的在线策略蒸馏,或者两者混合,同一套流程适用于终端、GUI、软件工程和工具调用等场景。如果你希望调整自己的代理策略,又不想把对话数据交给第三方,这是一个很实际的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目