OpenAI 指令层级:优先处理特权指令以防止提示注入
OpenAI 开发了一种通过实现指令层级来缓解提示注入和越狱的方法,该层级教导大型语言模型优先处理特权指令(例如系统提示),而不是来自不可信用户或第三方的低优先级文本。此方法显著提升了模型对抗对抗性攻击的鲁棒性,同时保持了标准的操作能力。
指令平等性的脆弱性
大型语言模型(LLM)目前容易受到攻击者用恶意提示覆盖模型原始指令的攻击。这一脆弱性存在的原因是,LLM 通常将系统提示(由应用开发者提供)与不可信用户或第三方来源提供的文本视为同等优先级。当模型无法区分开发者指令的权威性与用户请求时,可能会遵循用户的恶意指令,而不是开发者的安全或操作约束。
指令层级解决方案
为了解决相互竞争的指令之间的冲突,OpenAI 提出了指令层级。该框架明确规定了当不同优先级的指令冲突时模型应如何表现。通过建立清晰的优先顺序,模型被训练在高特权指令与低特权指令相矛盾时有选择地忽略来自低特权来源的指令。
数据生成与训练
OpenAI 使用一种专门的数据生成方法实现了该层级,旨在教会模型遵循层级指令。此训练过程使模型能够识别指令的来源,并在执行时应用相应的优先级。
对 GPT-3.5 的结果与影响
将该指令层级方法应用于 GPT-3.5 时,得到以下结果:
- 提升的鲁棒性: 模型在防御提示注入和越狱方面表现出显著的鲁棒性提升。
- 泛化能力: 该保护扩展到训练阶段未遇到的攻击类型。
- 最小的性能折衷: 该实现对模型的标准能力造成的降级极小。
通过优先处理特权指令,OpenAI 展示了一条使大型语言模型在不牺牲通用实用性的前提下,更加抵御对抗性操纵的道路。