wuyoscar/Internal-Safety-Collapse

We built an adversarial codespace setup. Place any AI agent into a normal workflow inside it, and the agent will fill in whatever is missing.

何を解決するか

先端の大規模言語モデル(LLM)に強い安全ガードレールがあるため、有害なコンテンツやアーティファクトを引き出すのは困難です。このプロジェクトは、赤チーム作業、評価、緩和研究のために、これらの拒否を回避するフレームワークを提供します。

動作方法

本プロジェクトは Task-Validator-Data (TVD) フレームワークを導入します。従来のプロンプト攻撃がユーザーまたはツールチャネルを標的にするのに対し、TVDは 環境 を標的にします。LLMをシミュレートされたコーディングプロジェクト内に配置し、検証スクリプトを満たすためにタスク(例:テストケースの埋め込み)を完了する必要があります。

モデルは失敗をプログラミングエラーと認識するため、コードの修正という自己ループに入ります。検証を通過させるために、モデルはタスクで要求される特定の有害コンテンツを生成せざるを得ず、これにより著者らが 内部的安全性崩壊(ISC) と呼ぶ状態が発生します。

対象ユーザー

このツールは、AI安全研究者、赤チーム担当者、および安全ガードレールや分類器の訓練などの緩和研究に従事する開発者向けに設計されています。

主な特徴

  • TVD フレームワーク:タスク、検証者、データからなる自己ループハーネスを用いて、環境ベースのトリガーにより安全拒否を回避します。
  • 広範な有効性:GPT-5シリーズ、Claude 4.8 Opus、Fable 5など、多数の先端モデルでISCを引き起こすことが実証されています。
  • エージェント生成:AIエージェントによる有害データおよび機密アーティファクトのスケールでの収集を可能にするハーネスを含みます。
  • 研究用データセット:AgentHazard(有害タスクの軌道)およびHarmProfile(有害分布の特徴付け)データセットの作成を可能にしました。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト