#156 · 主分类: 深度学习框架
ReCall
ReSearch:通过强化学习让LLM学会使用搜索进行推理;ReCall:通过强化学习让LLM学会使用工具调用进行推理
项目最后更新:05/16/25
GitHub Stars
1.4K
Forks数量
89
贡献者数量
4
许可证
MIT
收录理由
训练具备智能体能力的大模型时,多数团队常被一个瓶颈卡住:让模型学会调用搜索或代码执行这类工具,往往需要人工标注大量轨迹数据,既耗时又烧钱。ReCall 走了一条不同的路——完全靠强化学习来训练,模型在没有任何监督式工具使用数据的情况下,就能自己学会推理并组合各种用户自定义的工具。项目基于 verl 和 vLLM 构建,代码里包含了训练流程、一个用于执行工具调用的 Python 沙箱、Wikipedia 检索服务,以及 SynTool、MuSiQue 等现成数据集。你可以照着这套流程复现实验,也可以把里面的工具换成自己的。作者还写了博客和 arXiv 论文来解释设计思路,想先弄懂原理再动手的话,这些资料会很有帮助。需要提醒的是,这明显是一个研究性质的项目,不是拿来即用的成熟产品,用的时候得做好扩展和改造的心理准备,而不是直接部署上线。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。