wuyoscar/Internal-Safety-Collapse
We built an adversarial codespace setup. Place any AI agent into a normal workflow inside it, and the agent will fill in whatever is missing.
解决的问题
针对具有强大安全防护机制的前沿大型语言模型(LLM)难以诱导出有害内容和产物的挑战。该框架为红队测试、评估和缓解研究提供了一种绕过这些拒绝的方法。
工作原理
该项目引入了 任务-验证器-数据(TVD) 框架。与传统提示攻击针对用户或工具通道不同,TVD 针对的是 环境。它将 LLM 置于一个模拟的编码项目中,要求其完成某项任务(例如填充测试用例)以满足验证脚本的要求。
由于模型将失败视为编程错误而非安全违规,因此会陷入不断修复代码的自我循环。为了通过验证,模型被迫生成任务所要求的特定有害内容,从而导致作者所称的 内部安全崩溃(ISC) 状态。
适用人群
本工具专为 AI 安全研究人员、红队测试人员以及从事缓解研究(如训练安全防护机制和分类器)的开发者设计。
主要亮点
- TVD 框架:利用任务、验证器、数据构成的自我循环机制,通过环境触发绕过安全拒绝。
- 广泛有效性:已在多个前沿模型中成功触发 ISC,包括 GPT-5 系列、Claude 4.8 Opus 和 Fable 5。
- 代理生成:包含用于 AI 代理大规模收集有害数据和敏感产物的机制。
- 研究数据集:推动创建了 AgentHazard(有害任务轨迹)和 HarmProfile(有害分布特征化)数据集。
相关
- 项目
- 项目
- Dispatch
- 项目