#145 · 主分类: 深度学习框架

safe-rlhf

ai-safety alpaca beaver datasets deepspeed gpt large-language-models llama llm llms reinforcement-learning reinforcement-learning-from-human-feedback rlhf safe-reinforcement-learning safe-reinforcement-learning-from-human-feedback safe-rlhf safety transformer transformers vicuna

安全RLHF:基于安全的人类反馈强化学习的约束价值对齐

项目最后更新:11/24/25

GitHub Stars

1.6K

Forks数量

134

贡献者数量

4

许可证

Apache-2.0

收录理由

Beaver 是北京大学 PKU-Alignment 团队开源的 RLHF 训练框架,它的核心思路是把安全当作训练过程中的显式约束,而不是事后修补。项目覆盖了从监督微调到奖励模型、成本模型训练,再到标准 RLHF 和带约束的 Safe RLHF 的完整对齐流程,支持 LLaMA、OPT、Baichuan 等主流模型。同时,它提供了规模可观的人工标注偏好数据集(接近百万对,同时标注了 helpfulness 和 harmfulness),并附带了预训练的 Beaver-7B 检查点,研究者可以直接复现或扩展已发表的实验,不必从零搭建管线。内置的 BIG-bench 和 GPT-4 评估接口,也方便验证约束训练的实际效果。对于已经熟悉 DeepSpeed 的团队,这套后端用起来会比较顺手。整体上更适合做对齐研究和自定义偏好数据集的场景,而不是拿来即用的生产部署方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目