#179 · 主分类: 深度学习框架
RL4LMs
一个模块化的RL库,用于根据人类偏好微调语言模型
项目最后更新:03/01/24
GitHub Stars
2.4K
Forks数量
201
贡献者数量
8
许可证
Apache-2.0
收录理由
RL4LMs 把强化学习微调语言模型所需的各个部件都准备好了,你只需关心奖励函数和策略设计,不用从头搭训练循环。它支持 PPO、A2C、TRPO 以及新提出的 NLPO 等在线策略算法,奖励函数覆盖二十多种自然语言生成指标,包括 ROUGE、BLEU、BERTSCORE、BLEURT 这类词汇或语义度量,也能用预训练分类器打分。策略模型可选因果语言模型或序列到序列模型,比如 GPT、T5、BART。项目提供预定义的 YAML 配置,方便复现实验,并已在摘要、翻译、对话生成、表格到文本等多项任务上做了大量测试。对于想做 RLHF 风格实验或自定义奖励的研究者来说,这是个不错的起点,不过代码偏研究导向,最后更新于 2024 年初,实际部署时可能需要自行调整。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。