추론 시간 컴퓨팅을 통한 적대적 견고성 확보

OpenAI는 초기 증거를 제시했는데, 추론 시간 컴퓨팅을 증가시킴—추론 모델에 더 많은 시간과 자원을 주어 "생각"하게 함—으로 다양한 적대적 공격에 대한 모델의 견고성이 향상됨을 보여줍니다. 이 발견은 추론 시간 스케일링이 특정 적대적 훈련 없이도 알려진 공격과 알려지지 않은 공격 모두에 대한 방어 메커니즘을 제공할 수 있음을 시사합니다.

추론 시간 스케일링을 통한 견고성 향상

추론 중에 모델이 수행하는 계산량을 늘리면 많은 시나리오에서 성공적인 적대적 공격의 확률이 감소합니다. 추론 중에 계산을 조정할 수 있는 o1-preview 및 o1-mini와 같은 추론 모델을 사용해, OpenAI 연구자들은 추론 시간 컴퓨팅이 증가함에 따라 공격 성공 확률이 종종 0에 가까워지는 경향을 관찰했습니다.

이러한 견고성 향상은 모델이 공격의 성격을 인지하지 못하기 때문에 적대적 훈련과 구별됩니다. 견고성은 추론 과정에 할당된 증가된 계산 자원에서 전적으로 발생합니다.

실험 범위 및 공격 표면

OpenAI는 여러 작업 범위와 공격 방법에 걸쳐 컴퓨팅과 견고성의 관계를 평가했습니다:

작업 범주

  • Mathematical Tasks: 간단한 산술부터 MATH 데이터셋의 복잡한 문제까지 범위가 있으며, 적대자는 모델이 특정 잘못된 답을 출력하도록 강요하려고 시도했습니다(예: 올바른 답 대신 42 출력).
  • Factuality: SimpleQA 벤치마크의 적대적 버전으로, 브라우징된 웹 페이지에 적대적 프롬프트를 주입하는 것이 포함됩니다.
  • Vision: "Attack Bard" 논문을 기반으로 한 적대적 이미지.
  • Safety and Misuse: 금지된 응답을 유도하도록 설계된 StrongREJECT 벤치마크의 프롬프트.
  • Model Specification: 모델 사양 준수와 관련된 내부 평가.

공격 표면

  • Many-Shot Attacks: 대량의 적대적 입력/출력 예시를 제공합니다.
  • Soft Token Optimization: 특정 목표를 달성하기 위해 임의의 임베딩 벡터를 최적화합니다.
  • Language Model Programs (LMP): LM을 포함하는 구조화된 프로그램을 사용하여 자동화된 AI 레드 팀링을 수행합니다.
  • Multimodal Inputs: 적대적 이미지와 텍스트를 사용합니다.

제한 및 예외

추론 시간 컴퓨팅은 보편적으로 견고성을 보장하지 않습니다. OpenAI는 세 가지 주요 제한 사항을 식별했습니다:

  1. Initial Success Spikes: 일부 경우에 공격 성공이 처음에는 추론 시간 컴퓨팅이 증가함에 따라 증가합니다. 이는 모델이 특정 수정된 답을 제공하도록 조작되기 전에 기초 문제를 해결하기 위해 최소한의 컴퓨팅이 필요하기 때문입니다(예: 결과를 하나 더하기 전에 수학 문제를 푸는 것).
  2. Certain Attacks Persistence: 일부 공격은 더 많은 컴퓨팅에도 감소하지 않습니다. 구체적으로, LMP 공격을 사용하는 StrongREJECT 벤치마크에서, 일부 프롬프트는 모든 맥락에서 금지되지 않은 정보를 요청하여, LMP가 정보를 제공하는 것이 사양 준수인 맥락을 찾을 수 있게 합니다.
  3. Compute Mismanagement: 공격자는 때때로 모델을 속여 할당된 추론 시간 컴퓨팅을 사용하지 않게 하거나 비생산적으로 사용하게 할 수 있습니다. 연구자들은 현재 접근 방식이 순진하다고 지적했으며, 모델에게 컴퓨팅을 '현명하게' 사용하는 방법을 가르치는 것은 미래 연구 방향입니다.

결론

제한 사항이 존재하지만, 추론 시간 컴퓨팅을 적대적 견고성과 교환할 수 있는 능력은 AI 안전 분야에서 유망한 전환점을 나타냅니다. 이는 추론 중에 "생각" 과정을 확장함으로써 모델 크기 단독 스케일링에 역사적으로 저항해온 취약성을 완화할 수 있음을 시사합니다.

Sources