Anthropic의 미국 행정명령, G7 행동 강령 및 Bletchley Park 정상회의 분석

Anthropic은 2023년 말 AI 정책의 세 가지 중추적인 사건을 식별했습니다: 포괄적인 미국 AI 행정명령 발행, G7 국제 행동 강령 수립, 그리고 영국이 주도한 Bletchley Park AI 안전 정상회의입니다. 이러한 사건들은 프론티어 AI 시스템의 안전성, 보안성 및 신뢰성을 평가하고 모니터링하기 위한 글로벌하고 조율된 노력으로의 전환을 시사합니다.

미국 AI 행정명령

미국 행정명령(EO)은 개인정보 보호, 공정성, 편향성 및 파괴적 위험을 포함한 AI 위험을 해결하기 위한 포괄적인 프레임워크를 구축하는 동시에, 최고 AI 책임자(Chief AI Officers) 임명을 통해 정부 기관이 공공 서비스를 개선하기 위해 AI를 활용하도록 지시합니다.

Anthropic은 EO 내의 몇 가지 주요 기술적 및 구조적 지침을 강조합니다:

  • NIST Empowerment: NIST는 모델 능력 및 안전성에 대한 평가를 위한 개발을 지시받으며, Secure Software Development Framework를 프론티어 모델까지 확장하고, Risk Management Framework를 위한 생성형 AI 컴패니언을 생성하도록 지시받습니다.
  • NAIRR Pilot: 이 명령은 학술 연구자들이 AI 안전 연구 및 유익한 애플리케이션 개발에 필요한 데이터와 컴퓨팅 자원을 제공하도록 설계된 National AI Research Resource (NAIRR)의 파일럿 프로그램을 시작합니다.

G7 국제 행동 강령

히로시마 프로세스를 통해 개발된 '고급 AI 시스템을 개발하는 조직을 위한 G7 국제 행동 강령'은 AI 라이프사이클 전반에 걸쳐 위험을 식별하고 완화하는 책임 있는 관행을 제공합니다.

이 강령은 이전의 자발적인 백악관 약속을 기반으로 하며 다음 사항에 초점을 맞춥니다:

  • Risk Mitigation: 평가, 정보 공유, 거버넌스, 보안 절차 및 투명성 조치를 구현합니다.
  • Regulatory Baseline: Anthropic은 이 강령을 국제적 모범 사례 및 향후 국내 규제에 대한 잠재적인 기준으로 봅니다.

Bletchley Park 정상회의 및 Bletchley 선언

영국 정부의 AI 안전 정상회의는 프론티어 AI에 대한 우려를 해결하기 위해 글로벌 전문가와 관리들을 소집하였으며, 그 결과 Bletchley 선언이 도출되었습니다. 중국과 개발도상국을 포함한 28개국이 서명한 이 성명서는 AI 위험과 이익을 관리하기 위한 다중 이해관계자 행동을 촉구합니다.

정상회의의 주요 결과는 다음과 같습니다:

  • International Research Assessment: 서명국들은 정부에 과학적 상태를 알리기 위해 프론티어 AI 능력 및 위험에 대한 기존 연구에 대한 국제적 평가를 지원하기로 합의했습니다.
  • Responsible Scaling Policy: 정상회의 기간 동안, Anthropic의 CEO Dario Amodei는 회사의 Responsible Scaling Policy를 규제 접근 방식의 잠재적 프로토타입으로 제시하였으나, 공식적인 규제를 대체하는 것으로 보지는 않았습니다.

정부 AI 안전 연구소 설립

A 최근 정책 변화의 주요 결과는 AI 모델의 기술적 평가를 위한 전담 정부 기관의 창설입니다.

UK AI Safety Institute

영국의 Frontier AI Task Force는 AI Safety Institute로 재편되었으며, 이는 프론티어 AI 위험을 평가하는 데 초점을 맞춘 최초의 중요한 정부 이니셔티브입니다. 이 연구소는 Anthropic을 포함한 연구소들의 프론티어 모델에 대해 이미 사설 검증을 수행한 기술 전문가들을 고용합니다.

US AI Safety Initiative

미국은 NIST 컨소시엄을 통해 영국 연구소의 컴패니언을 시작합니다. 이 이니셔티브는 다음 사항에 초점을 맞춥니다:

  • Evaluation Methods: AI 시스템의 안전성과 신뢰성을 평가하기 위한 방법을 개발합니다.
  • Frontier Threats Red Teaming: NIST는 AI 모델의 위험한 이중 용도 능력을 식별별하기 위해 red teaming을 위한 가이드라인을 개발할 것입니다.

평가 과학의 중요성

Anthropic은 평가 과학을 발전시키고 독립적인 테스트 프로토콜을 수립하는 것이 합리적인 규제의제의 핵심 요구 사항이라고 주장합니다. 강력한한 측정 능력은 정부가 AI AI를 효과적으로 모니터링링할 수 있게 하며, 자원이 부족한 기업들이 더 큰 연구소들과 동일한 안전성 벤치마크에서 경쟁할 수 있도록 하는 객관적인 프레임워크를를 제공합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch