앤트로픽 제3자 테스트 AI 정책 제안

요약

앤트로픽은 선도적인 AI 시스템에 대한 제3자 테스트 체제를 도입하여 안전성 주장의 검증과 사회적 피해 방지를 주장한다. 이 접근법은 산업, 정부, 학계가 참여하는 광범위한 신뢰할 수 있는 감독 인프라를 구축함으로써, 자율 규제만으로는 해결할 수 없는 위험을 관리하는 것을 목표로 한다.

제3자 감독의 필요성

선도적인 AI 시스템—대규모 생성 모델로, 막대한 계산 자원을 필요로 하는 시스템—은 다양한 하류 사용 사례에 적응할 수 있는 '모든 것을 할 수 있는 기계'로 작용한다. 이러한 시스템은 기반 모델의 능력과 약점을 그대로 물려받기 때문에, 기존의 산업별 규제 프레임워크에 잘 맞지 않는다.

앤트로픽은 자율 규제 프레임워크(예: 자체 Responsible Scaling Policy, RSP)가 필수적이라고 주장하지만, 단일 민간 주체가 내리는 결정에 의존하기 때문에 부족하다고 지적한다. 강력한 제3자 체제가 필요하며, 그 목적은 다음과 같다:

  • 안전성 검증: 선거의 공정성, 해로운 차별, 국가 안보 악용과 같은 모델의 행동에 대해 독립적인 검증을 제공한다.
  • 비극적 사고 방지: 코드에 취약점을 삽입하거나 인간의 의도와 모순되는 행동을 하는 등, 새로운 자율적 행동을 식별한다.
  • '반사적 규제' 회피: 주요 사고를 예방하기 위해 효과적인 규제를 사전에 설계함으로써, 억압적이고 비효율적인 법적 반응을 막는다.

강력한 테스트 체제를 위한 프레임워크

효과적인 테스트 체제는 가장 계산 자원을 많이 소모하는 대규모 시스템에만 적용되어야 하며, 소규모 기업이 불리하게 되는 것을 방지해야 한다. 앤트로픽은 다음과 같은 구조적 요소를 제안한다.

이단계 테스트 과정

  1. 자동화 단계: 거짓 음성(양성)을 피하기 위해 편향된 빠르고 포괄적인 테스트 단계로, 잠재적 문제를 신속히 탐지한다.
  2. 전문가 단계: 탐지된 문제에 대해 전문가가 주도하는 심층적인 2차 테스트를 실시한다.

다양한 테스트 생태계

다양한 주체가 테스트를 수행함으로써 합법성과 경쟁을 보장해야 한다:

  • 민간 기업: 계약을 통해 위탁받은 기업(예: Gryphon Scientific) 또는 금융 회계에서 사용하는 감사 회사와 유사한 기업.
  • 대학: 학술 기관이 테스트 프로젝트를 운영하며, 정부 기관의 감독을 받을 수 있다.
  • 정부: 특정 법적 의무가 있는 영역, 특히 기밀 국가 안보 위험과 관련된 영역에 대해 직접 테스트를 수행한다.

구현을 위한 핵심 요건

  • 공동 표준: 산업, 정부, 학계 간에 안전성 테스트 프레임워크가 포함해야 할 사항에 대한 합의.
  • 정부 재정 지원: NIST, 미국 AI 안전 연구소 등 정부 기관이 테스트 개발 및 분석을 위한 기술적 업무를 수행할 수 있도록 자금을 증대.
  • 공공 인프라: 학계와 정부가 선도적인 시스템을 연구하고 테스트할 수 있는 독립적 역량을 갖출 수 있도록 '국가 연구 클라우드'를 구축.

국가 안보 및 고위험 기능

앤트로픽은 제3자 테스트가 특히 중요한 영역으로 국가 안보를 지목한다. 구체적으로, 생물무기 개발을 가속화하거나 복잡한 사이버 공격을 수행할 수 있는 능력이 있는지 시스템을 테스트해야 한다. 이러한 능력이 발견될 경우, 앤트로픽은 광범위하게 배포되는 모델에서 해당 기능을 제거하거나, '고객 확인(KYC)' 체제를 도입하는 등의 완화 조치를 제안한다.

오픈소스 모델과 규제 캡처 대응

공개적으로 배포된 모델

앤트로픽은 오픈소스 연구의 가치를 인정하지만, 모델이 점점 더 강력해질수록 완전한 공개적 배포 문화가 사회적 안전과 충돌할 수 있다고 지적한다. 모델이 공개적으로 배포될 경우, 오용을 가능하게 할 수 있는 미세 조정에 강건해야 한다고 제안한다. 제3자 테스트는 비용이 드는 규제 협회가 아닌, 비용 효율적인 측정과 제3자 역량에 초점을 맞추어, 프로프라이어터 모델과 오픈웨이트 모델 모두에 일관된 기준을 적용할 수 있는 유일한 합법적인 방법이라고 주장한다.

규제 캡처 방지

강력한 자원을 가진 AI 기업이 규제를 이용해 경쟁을 억압하는 것을 방지하기 위해, 앤트로픽은 대규모 기업과 독립된 테스트 역량을 확보해야 한다고 주장한다. 측정과 제3자 역량에 초점을 맞추는 정책은 소규모 개발자에게도 공평한 경쟁 환경을 유지하는 데 기여한다.

앤트로픽의 지원 약속

이 체제를 개발하는 데 도움을 주기 위해, 앤트로픽은 다음과 같은 약속을 한다:

  • Responsible Scaling Policy (RSP)를 통해 테스트 체제를 프로토타이핑한다.
  • 계약자 및 정부 파트너를 통해 제3자 평가를 테스트한다.
  • 위험과 완화 조치를 명확히 하기 위해 선도적인 레드팀 활동을 확장한다.
  • NIST 등 기관의 정부 재정 지원과 국가 연구 인프라 개발을 적극적으로 촉진한다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch