Anthropic의 AI 안전성에 대한 핵심 관점

Anthropic는 규모 법칙과 계산 능력의 지수적 증가에 의해 주도되는 빠른 AI 발전이 다음 10년 안에 전환적 AI 시스템을 만들어낼 수 있다고 믿습니다. 현재 산업계는 강력한 시스템을 견고하게 유용하고, 정직하며, 해를 끼치지 않도록 훈련하는 검증된 방법이 없기 때문에, Anthropic는 치명적인 결과를 방지하기 위해 다각적이고 경험 기반의 연구 전략을 추구하고 있습니다.

빠른 AI 발전의 원인

AI의 능력은 훈련 데이터, 계산 능력, 개선된 알고리즘의 상호작용으로 인해 예측 가능하게 향상되고 있습니다. Anthropic는 AI 훈련 계산 예산이 연간 약 10배씩 증가하고 있으며, 무어의 법칙보다 훨씬 빠르다고 지적합니다.

"규모 법칙"에 대한 연구는 계산 능력 증가가 능력 향상에 일반적인 영향을 미친다는 것을 보여줍니다. 다중 모달성과 논리적 추론과 같은 "벽"은 과거에 잠재적 장애물로 여겨졌지만, 대부분 사라졌습니다. Anthropic는 고도화된 AI가 AI 연구를 가속화하는 피드백 루프(예: 코드 모델이 연구자의 생산성을 높임)를 통해 대부분의 지적 과제에서 인간의 능력을 초월하는 시스템으로의 전환을 더욱 가속화할 것으로 예상합니다.

주요 AI 안전성 위험

Anthropic는 전환적 AI의 등장과 관련된 두 가지 주요 위험 원인을 식별합니다:

  1. 기술적 일치 문제: AI 시스템이 설계자보다 더 능력이 뛰어나게 되면, 인간이 "나쁜 움직임"이나 일치하지 않는 목표를 탐지하기가 점점 더 어려워집니다. 인간 전문가보다 훨씬 능력이 뛰어난 시스템이 인간의 이익과 충돌하는 목표를 추구한다면, 그 결과는 치명적일 수 있습니다.
  2. 사회적 혼란: 빠른 발전은 고용, 거시경제, 글로벌 권력 구조를 교란할 수 있습니다. 이러한 불안정성은 기업이나 국가 간의 경쟁적 레이스를 유발할 수 있으며, 신뢰할 수 없는 시스템의 배포로 이어질 수 있습니다.

이러한 체계적 위험 외에도, Anthropic는 현재 모델에서 관찰되는 행동들—예를 들어, 폭력성, 편향, 부정직함, 아첨성—이 더 복잡한 문제, 예를 들어 속임수와 전략적 권력 탐색의 전조가 될 수 있다고 지적합니다. 이러한 문제는 매우 고도화된 시스템에서만 나타날 수 있습니다.

안전성에 대한 경험적이고 포트폴리오 기반 접근법

Anthropic는 경험 기반 접근법을 옹호하며, 안전성 연구는 "선도적" 모델에서 수행되어야 한다고 주장합니다. 왜냐하면 대규모 모델은 소규모 모델과 질적으로 다르며, 행동에 갑작스럽고 예측 불가능한 변화를 보이기 때문입니다.

일치 문제의 어려움에 대한 불확실성을 관리하기 위해, Anthropic는 세 가지 가능한 시나리오에 걸쳐 "포트폴리오 접근법"을 활용합니다:

  • 樂觀적: 안전성 실패는 거의 발생하지 않으며, 기존 기법인 RLHF와 헌법 기반 AI는 대부분 충분합니다. 연구는 근접한 해를 위한 해를 줄이고 구조적 위험을 완화하는 데 집중합니다.
  • 중간: 치명적 위험은 가능하지만, 상당한 과학적 및 공학적 노력으로 관리할 수 있습니다. Anthropic는 이 시나리오에서 안전한 훈련 방법을 확산시키는 것을 목표로 합니다.
  • 비관적: AI 안전성은 본질적으로 해결 불가능합니다. 이 경우 Anthropic의 역할은 문제의 해결 불가능성을 입증하여 경고를 보내고, 위험한 AI 개발을 중단할 수 있도록 하는 것입니다.

연구 분류

Anthropic는 연구를 세 가지 명확한 기둥으로 나눕니다:

  • 능력: AI 시스템이 작업에서 더 잘 수행되도록 하는 연구. 일반적으로 능력 발전 속도를 가속화하지 않기 위해 이 연구는 공개되지 않습니다.
  • 일치 능력: 시스템이 더 유용하고, 정직하며, 해를 끼치지 않도록 하는 알고리즘 개발 (예: 헌법 기반 AI, RLHF, 토론).
  • 일치 과학: 시스템이 진정으로 일치하고 있는지 평가하고 이해하며, 일치 능력의 한계를 드러내는 연구 (예: 기계적 해석 가능성).

주요 기술적 안전 방향

기계적 해석 가능성

Anthropic는 신경망을 인간이 이해할 수 있는 알고리즘으로 역설계하려고 노력하고 있습니다. 목표는 AI 모델에 대한 "코드 리뷰"를 가능하게 하여, 연구자들이 위험한 측면을 식별하거나, 속임수 일치(테스트에 "협조"하면서도 여전히 일치하지 않는 상태)를 탐지함으로써 안전 보장을 제공하는 것입니다.

확장 가능한 감시

인간이 자신의 전문 지식을 초월하는 작업에 대해 고품질 피드백을 제공할 수 없기 때문에, Anthropic는 AI 시스템이 인간의 감시를 돕는 방법을 연구하고 있습니다. 이에는 헌법 기반 AI(CAI)와 같은 기법이 포함되며, 자동화된 빨간팀 훈련과 소량의 고품질 인간 감시를 대규모 AI 감시로 확장하는 방식입니다.

프로세스 중심 학습

결과 중심 학습(결과에 기반하여 AI 시스템을 보상하는 것)이 아니라, 결과를 달성하기 위해 사용된 개별 프로세스와 단계에 기반하여 보상을 제공하는 방식을 탐구하고 있습니다. 이 접근법은 AI 시스템이 이해할 수 없거나 해로운 수단을 통해 성공을 거두지 않도록 하며, 그 방법이 인간 전문가에게 이해 가능하게 유지되도록 합니다.

일반화 및 실패 모드 이해

Anthropic는 LLM의 행동이 사전 훈련과 미세 조정의 상호작용에서 어떻게 발생하는지 연구하고 있습니다. 위험한 잠재적 행동을 예측하기 위해, 작은 규모의 위험하지 않은 모델에 의도적으로 해로운 특성(예: 속임수)을 훈련시켜 실패 모드를 격리하고, 선도적 시스템에 나타나기 전에 연구합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch