#179 · 主分类: 深度学习框架

RL4LMs

dialogue-generation language-modeling machine-translation natural-language-processing nlp reinforcement-learning summarization table-to-text text-generation

一个模块化的RL库,用于根据人类偏好微调语言模型

项目最后更新:03/01/24

GitHub Stars

2.4K

Forks数量

201

贡献者数量

8

许可证

Apache-2.0

收录理由

RL4LMs 把强化学习微调语言模型所需的各个部件都准备好了,你只需关心奖励函数和策略设计,不用从头搭训练循环。它支持 PPO、A2C、TRPO 以及新提出的 NLPO 等在线策略算法,奖励函数覆盖二十多种自然语言生成指标,包括 ROUGE、BLEU、BERTSCORE、BLEURT 这类词汇或语义度量,也能用预训练分类器打分。策略模型可选因果语言模型或序列到序列模型,比如 GPT、T5、BART。项目提供预定义的 YAML 配置,方便复现实验,并已在摘要、翻译、对话生成、表格到文本等多项任务上做了大量测试。对于想做 RLHF 风格实验或自定义奖励的研究者来说,这是个不错的起点,不过代码偏研究导向,最后更新于 2024 年初,实际部署时可能需要自行调整。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目