#172 · 主分类: 深度学习框架

trlx

machine-learning pytorch reinforcement-learning

一个用于通过人类反馈强化学习(RLHF)分布式训练语言模型的仓库

项目最后更新:01/08/24

GitHub Stars

4.8K

Forks数量

486

贡献者数量

56

许可证

MIT

收录理由

当你想用强化学习微调语言模型,又不愿从零搭建整套RL机制时,trlX能替你处理这些繁重环节。它支持PPO、ILQL等算法,你只需提供手写的奖励函数或带奖励标签的数据集来驱动训练。针对Hugging Face上约20B参数以内的模型,框架基于Accelerate提供训练器;若模型规模更大,则可换用NeMo后端,通过并行策略将同一套算法扩展到更庞大的模型上。这样一来,一个在科研笔记本上起步的偏好调优实验,不必切换框架就能平滑迁移到多GPU环境运行。项目还附带面向小型GPT-2任务(比如情感控制)的Colab笔记本,上手学习这套方法也比较方便。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目