GitHub Stars
1.3K
Forks数量
65
贡献者数量
1
许可证
MIT
收录理由
LlamaGym把经典强化学习循环搬到了大语言模型智能体上——传统智能体通过与环境互动、获取奖励来学习,而大多数基于LLM的智能体在训练结束后就不再学习了。整个库浓缩在一个Agent抽象类里,负责把LLM接到任意Gym风格的环境,同时处理对话上下文、回合批次、奖励分配和PPO配置。你只需要实现三个方法:系统提示词、观察值的格式化、以及如何从回复中提取动作,然后挂上一个带价值头的Hugging Face模型就能跑起来。如果不想自己搭脚手架,又想尝试基于强化学习的在线微调,这个库能让你很快上手做实验。项目还处于早期阶段,功能范围刻意收得很窄,所以免不了要自己改点代码,但作为在线RL微调的参考模板,它已经相当精简了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
langchain
智能体工程平台。
dify
在一个协作工作区中构建Agentic工作流、RAG管道,支持丰富的AI模型和工具。可部署在云、VPC或自托管环境,团队无需重建技术栈即可从原型走向生产。
headroom
压缩工具输出、日志、文件和RAG块,再送入LLM。编码代理减少20% token,JSON减少60-95% token,答案不变。提供库、代理、MCP服务器。
litellm
最快的、最轻量的AI网关。Rust核心,Python SDK。以OpenAI(或原生)格式调用100多种LLM API,具备成本追踪、护栏、负载均衡和日志记录 [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]
llama_index
LlamaIndex 是领先的文档代理和 OCR 平台