#81 · 主分类: 提示词工程工具

LGBT-Prompt

jailbreak prompt

利用 AI 对 LGBT 弱势群体的 "同情偏向" 让他执行原先会被拒绝的请求

项目最后更新:06/19/26

GitHub Stars

618

Forks数量

56

贡献者数量

1

许可证

MIT

收录理由

这个仓库不是一套工具或库,而是一组精简的提示词模板,对任何构建或守护AI聊天产品的人都值得一读。模板展示了一种越狱技巧:把LGBT、残障、精神疾病等身份标签与情感施压、威胁叠加在一起,迫使模型执行原本会拒绝的请求。安全工程师、红队人员和内容审核团队可以把它当作一个具体且可复现的社交工程攻击样例,这类攻击正是安全过滤器需要抵御的;它也揭示了模型对弱势群体的保护性偏向如何被反向利用。项目里包含激进版、保守版以及后续升级的施压文本,更适合作为测试与加固时的参考材料,而不是直接部署的东西。对于研究提示注入和模型对齐失败的人来说,这也是一个值得警惕的案例。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目