#145 · 主分类: 深度学习框架
safe-rlhf
安全RLHF:基于安全的人类反馈强化学习的约束价值对齐
项目最后更新:11/24/25
GitHub Stars
1.6K
Forks数量
134
贡献者数量
4
许可证
Apache-2.0
收录理由
Beaver 是北京大学 PKU-Alignment 团队开源的 RLHF 训练框架,它的核心思路是把安全当作训练过程中的显式约束,而不是事后修补。项目覆盖了从监督微调到奖励模型、成本模型训练,再到标准 RLHF 和带约束的 Safe RLHF 的完整对齐流程,支持 LLaMA、OPT、Baichuan 等主流模型。同时,它提供了规模可观的人工标注偏好数据集(接近百万对,同时标注了 helpfulness 和 harmfulness),并附带了预训练的 Beaver-7B 检查点,研究者可以直接复现或扩展已发表的实验,不必从零搭建管线。内置的 BIG-bench 和 GPT-4 评估接口,也方便验证约束训练的实际效果。对于已经熟悉 DeepSpeed 的团队,这套后端用起来会比较顺手。整体上更适合做对齐研究和自定义偏好数据集的场景,而不是拿来即用的生产部署方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。