#172 · 主分类: 深度学习框架
trlx
machine-learning
pytorch
reinforcement-learning
一个用于通过人类反馈强化学习(RLHF)分布式训练语言模型的仓库
项目最后更新:01/08/24
GitHub Stars
4.8K
Forks数量
486
贡献者数量
56
许可证
MIT
收录理由
当你想用强化学习微调语言模型,又不愿从零搭建整套RL机制时,trlX能替你处理这些繁重环节。它支持PPO、ILQL等算法,你只需提供手写的奖励函数或带奖励标签的数据集来驱动训练。针对Hugging Face上约20B参数以内的模型,框架基于Accelerate提供训练器;若模型规模更大,则可换用NeMo后端,通过并行策略将同一套算法扩展到更庞大的模型上。这样一来,一个在科研笔记本上起步的偏好调优实验,不必切换框架就能平滑迁移到多GPU环境运行。项目还附带面向小型GPT-2任务(比如情感控制)的Colab笔记本,上手学习这套方法也比较方便。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。