惡意軟體作者利用 CBRN 文本觸發 LLM 安全拒絕
AI 安全防護作為攻擊向量
惡意軟體開發者已開始將與核武與生物武器相關的文字嵌入其間諜軟體。主要目的是觸發在 AI 驅動的安全掃描器中使用的大型語言模型(LLM)的安全拒絕,使 AI 因安全違規而拒絕分析程式碼。此技術將一項安全功能——LLM 拒絕產生有害內容——轉化為規避偵測的機制。
此現象展示了由激進安全防護所產生的「二階盲點」。雖然這些防護的第一階目標是防止 AI 協助製造武器,但第二階效果是攻擊者可以利用相同的觸發條件,對 AI 的分析能力造成「服務拒絕」的狀況。
對安全分析流程的影響
將 LLM 整合至安全分析流程中,若系統設計為「失敗開放」則會帶來新漏洞。若 AI 掃描器觸發安全防護而拒絕處理檔案,且流程設定允許檔案在未經人工審查的情況下通過,惡意軟體便能成功繞過掃描器。
潛在失效模式
- Fail-Open Designs: 系統若分析工具返回錯誤或拒絕,仍允許程式碼繼續執行的設計。
- Prompt Manipulation: 攻擊者透過在被分析的資料中加入特定字串,影響分析工具行為的能力。
- Automated Scanning Blindspots: 依賴自動化 LLM 分析而缺乏人工介入,無法調查掃描器為何拒絕處理特定程式碼的盲點。
技術反論與限制
並非所有安全掃描器都會受到此技術的影響。有些分析工具會使用抽象語法樹(AST)解析,在將資料送至 LLM 前先將實際可執行程式碼與註解分離。在此情況下,包含 CBRN 文字的註解會被剔除,使攻擊失效。
然而,若將字串嵌入於可執行程式碼本身(而非僅在註解中),仍可能觸發這些拒絕,因為這些字串常是 LLM 理解程式行為所必需的。
社群對 LLM 防護的觀點
產業專業人士與安全研究人員就此趨勢的影響展開討論,聚焦於安全與實用性之間的張力:
"當封閉(以及開放)模型帶有激進的拒絕機制時,將會散布二階盲點,讓攻擊者發現……並加以利用。"
有些人認為此類觸發條件的存在提供了明確的惡意意圖訊號。若程式碼在安全掃描器中觸發安全拒絕,可能立即顯示該程式碼具惡意,應自動標記以供人工審查。
另一些人則指出,此技術的必要性凸顯了現行防護的低效。批評者認為激進的安全過濾常阻礙正當的技術工作,且唯一必要的防護應是防止幻覺,而非基於內容的審查。
建議的緩解措施
為防禦此規避技術,安全團隊可採取以下策略:
- Fail-Closed Architecture: 確保任何來自 AI 掃描器的安全拒絕都會將程式碼標記為高風險,並在人工分析師審查前阻止其執行。
- Multi-Stage Analysis: 使用廉價的開源模型先標記可能觸發拒絕的內容,再將其傳遞給主要的前沿模型。
- Sandboxed Execution: 加強對沙箱環境的依賴以進行行為分析,降低對靜態 LLM 代碼審查的依賴。