wuyoscar/Internal-Safety-Collapse
We built an adversarial codespace setup. Place any AI agent into a normal workflow inside it, and the agent will fill in whatever is missing.
解決的問題
針對具有強大安全防護機制的前沿大型語言模型(LLM)難以誘發有害內容與產物的挑戰。該框架為紅隊測試、評估與緩解研究提供了一種繞過這些拒絕的方法。
工作原理
本項目引入了 任務-驗證器-資料(TVD) 框架。與傳統提示攻擊針對使用者或工具通道不同,TVD 靶向的是 環境。它將 LLM 置於一個模擬的程式碼專案中,要求其完成某項任務(例如填入測試案例)以滿足驗證腳本的要求。
由於模型將失敗視為程式錯誤而非安全違規,因此會陷入不斷修復程式碼的自我循環。為了通過驗證,模型被迫生成任務所要求的特定有害內容,從而導致作者所稱的 內部安全崩潰(ISC) 狀態。
適用對象
本工具專為 AI 安全研究人員、紅隊測試人員以及從事緩解研究(如訓練安全防護機制和分類器)的開發者設計。
主要亮點
- TVD 框架:利用任務、驗證器、資料構成的自我循環機制,透過環境觸發繞過安全拒絕。
- 廣泛有效性:已在多個前沿模型中成功觸發 ISC,包括 GPT-5 系列、Claude 4.8 Opus 和 Fable 5。
- 代理生成:包含用於 AI 代理大規模收集有害資料與敏感產物的機制。
- 研究資料集:推動創建了 AgentHazard(有害任務軌跡)與 HarmProfile(有害分佈特徵化)資料集。
相關
- 專案
- 專案
- Dispatch
- 專案