앤트로픽: 집중적 AI 규제의 필요성

앤트로픽은 AI 기능이 발전함에 따라 다음 18개월 내에 정부가 집중적 AI 정책을 도입해야 한다고 주장한다. 이는 치명적인 위험을 막기 위함이다. 회사는 합리적이고 좁은 범위의 규제가 과학적·상업적 진보를 방해하지 않으면서도 이러한 위험을 완화할 수 있다고 주장하며, 비효율적이고 부담스러운 '반응형 규제'의 위험을 피해야 한다고 강조한다.

사이버 및 CBRN 분야의 가속화된 위험

수학, 추론, 코딩 분야의 AI 능력이 급속도로 발전하면서 악용 가능성과 자율적인 파괴적 행동의 위험이 증가하고 있다. 앤트로픽은 두 가지 주요 우려 영역을 지적한다.

사이버 능력

소프트웨어 공학 작업에서 모델의 성능이 크게 향상되었다. SWE-bench 벤치마크에서 성능은 2023년 10월 클로드 2의 1.96%에서 2024년 3월 디빈의 13.5%로, 그리고 2024년 10월 클로드 3.5 손넷의 49%까지 상승했다. 앤트로픽의 프론티어 레드팀 보고서에 따르면 현재 모델들은 이미 사이버 공격 작업을 지원하고 있으며, 다음 세대 모델은 장기적이고 다단계 작업 계획이 가능한 점에서 더 효과적일 것으로 예상된다.

CBRN 위험

AI 시스템은 생물학과 화학 분야에서 전문가 수준의 지식을 보여주고 있다. 영국 AI 안전 연구소는 일부 모델이 박사 수준의 전문가와 맞먹는 과학적 답변을 제공함을 발견했다. 이는 GPQA 벤치마크의 가장 어려운 섹션에서 나타나며, 2023년 11월의 38.8%에서 2024년 6월 클로드 3.5 손넷의 59.4%로 상승했고, 2024년 9월 오픈AI o1의 77.3%까지 도달했다. 인간 전문가의 성능은 81.2%이다.

책임 있는 확장 정책(RSP) 프레임워크

앤트로픽은 치명적 위험을 식별하고 완화하기 위한 유연한 프레임워크로 책임 있는 확장 정책(RSP)을 활용한다. RSP는 두 가지 핵심 원칙에 기반한다:

  • 비례성: 모델이 정의된 "능력 기준"을 충족할수록 안전 및 보안 조치의 강도가 증가한다.
  • 반복성: 능력은 정기적으로 측정되며, 새로운 발견에 따라 안전 전략이 업데이트된다.

앤트로픽에 따르면 RSP는 세 가지 주요 조직적 이점을 제공한다. 즉, 보안 및 안전 평가에 조기에 투자하도록 유도하며, 구체적인 위협 모델 개발을 요구하고, 악용 완화 방안에 대한 투명성을 장려한다.

효과적인 AI 규제를 위한 제안 원칙

앤트로픽은 RSP가 강제 가능한 정부 규제의 원형이 되어야 한다고 제안한다. 효과적인 규제 프레임워크를 위해 세 가지 핵심 요소를 제시한다.

  1. 투명성: 정부는 새로운 AI 시스템 세대마다 RSP 유사 정책과 위험 평가를 공개하도록 기업에 요구해야 하며, 이러한 주장의 정확성을 검증할 수 있는 메커니즘이 필요하다.
  2. 안전 유도: 규제는 효과적인 RSP 개발을 장려해야 한다. 이는 규제 기관이 위협 모델을 식별하거나 표준을 명시하거나 RSP 간 비교를 통해 "안전성 경쟁"을 촉진함으로써 가능하다.
  3. 단순성과 집중성: 규제는 "정밀한" 방식이어야 하며, 불필요한 부담이나 비논리적인 규칙을 피해 치명적 위험 예방의 목적을 방해하지 않아야 한다.

시행 및 전략적 고려사항

앤트로픽은 이러한 규제의 시행과 관련된 여러 전략적 질문을 다룬다.

관할권과 범위

미국의 연방법이 균일한 규제와 국제 협상의 이상적인 수단이지만, 연방 절차가 너무 느릴 경우 주 정부 규제가 필요할 수 있는 보완책이 될 수 있다고 앤트로픽은 제안한다. 국제적으로는 공통된 안전 및 보안 접근 방식이 표준화와 상호 인증을 통해 글로벌 비즈니스 비용을 줄일 수 있다고 주장한다.

모델 기반 vs. 사용 사례 기반 규제

앤트로픽은 일반 목적 모델에 대해 "사용 사례 기반 규제"를 반대한다. 클로드.ai나 ChatGPT와 같은 모델은 다양한 작업을 수행할 수 있는 일반 제품이므로, 기초 베이스 모델의 기본 특성과 안전 조치를 규제하는 것이 더 실용적이다. 또한, 훈련에 자원이 많이 소모되는 점을 고려하면, 이는 규제의 가장 쉬운 지점이기도 하다.

혁신 및 오픈소스에 대한 영향

앤트로픽은 적절하고 유연한 규제가 혁신을 크게 방해하지 않을 것이라고 주장한다. 안전 연구는 일반 AI 과학에 대한 부수적 이익을 가져올 수 있으며, 강력한 보안은 지적 재산권 유출을 방지한다. 오픈웨이트 모델에 관해서는, 규제는 모델의 웨이트 공유 여부가 아니라 실질적인 위험 측정 기반으로 이루어져야 한다고 주장한다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch