#158 · 主分类: 深度学习框架
TextRL
在huggingface的transformer(blommz-176B/bloom/gpt/bart/T5/MetaICL)上实现ChatGPT RLHF(基于人类反馈的强化学习)
项目最后更新:04/23/26
GitHub Stars
564
Forks数量
61
贡献者数量
3
许可证
MIT
收录理由
TextRL 面向那些想用强化学习微调语言模型、却不想直接面对 HuggingFace TRL 原始 API 的团队。它在 TRL 之上加了一层简洁封装:用一份配置数据类管理参数,每个算法族对应一个训练器类,因此从 GRPO、RLOO 切换到 DPO、KTO 或奖励模型训练,通常只需改动几个配置字段,无需重写训练循环。奖励函数就是普通的可调用对象,可以加装饰器自由组合,任何 HuggingFace 的 pipeline 也能当作基于分类器的奖励来用,这在希望生成结果朝某个可量化目标靠拢时特别顺手。库还处理了实际运行中的琐碎环节,比如 LoRA 和 QLoRA 的加载、基于 accelerate 的分布式启动,以及 GRPO 可选的 vLLM 推理加速。如果你本来就在 TRL 生态里工作,这个库能给你一个更轻量的 RLHF 实验入口,同时保留底层训练器的全部能力。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。