#164 · 主分类: 网络安全与解密工具

PromptInject

adversarial-attacks agi agi-alignment ai-alignment ai-safety chain-of-thought gpt-3 language-models large-language-models machine-learning ml-safety prompt-engineering

PromptInject 是一个以模块化方式组装提示(prompts)的框架,用于对大型语言模型(LLMs)面对对抗性提示攻击的鲁棒性进行定量分析。🏆 NeurIPS ML Safety Workshop 2022 最佳论文奖

项目最后更新:04/27/26

GitHub Stars

521

Forks数量

55

贡献者数量

1

许可证

MIT

收录理由

任何把大模型放到用户面前的人,迟早会担心陌生人用一句话就让模型偏离指令。PromptInject 把这种担心变成可量化的测试:它用模块化零件拼出基础提示词,再注入恶意用户输入,专门演练两类攻击——目标劫持和提示词泄露。安全工程师和红队人员可以拿它反复测试自己的系统提示词到底多扛得住“忽略之前指令”这类输入,不用再凭直觉拍脑袋。这些攻击手法出自 NeurIPS ML Safety Workshop 的获奖论文,定义来自公开研究,不是临时拍脑袋想出来的。不过代码是围绕 GPT-3 时代的 API 写的,要用于新模型得自己改一改,把它当成持续评估平台的起点比较合适,别指望开箱即用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目