NTIA에 대한 Anthropic AI 책임성 권고안

Anthropic은 국가통신정보행정국(National Telecommunications and Information Administration, NTIA)의 인공지능 책임성에 관한 의견 수렴 요청에 공식적으로 응답했습니다. 이 제안은 모델의 능력이 증가함에 따라 안전성과 책임성을 보장하기 위한 체계적인 접근 방식을 제시합니다.

표준화된 평가 및 자금 지원

Anthropic은 AI 모델 평가 연구를 위한 정부 자금을 늘려 엄격하고 표준화된 벤치마크를 만들 것을 권고합니다. 이러한 평가를 개발하는 것은 자원을 많이 요구하므로, 공공 자금은 진전을 이끄는 핵심 요소로 간주됩니다.

평가에 대한 주요 제안은 다음과 같습니다:

  • 공개 요구사항: AI 기업은 지적재산권(IP)과 기밀 정보를 보호하기 위해 공개는 아니지만, 규제 기관에 평가 방법과 결과를 공개하도록 의무화해야 합니다.
  • 산업 표준: 국가표준기술연구소(National Institute of Standards and Technology, NIST)와 산업계가 협력하여 모델의 능력, 한계 및 위험을 평가하기 위한 최선의 실천 방안과 벤치마크를 수립해야 합니다.

위험 대응형 평가 및 기준 설정

모델이 초래하는 위험에 비례한 규제를 보장하기 위해, Anthropic은 자율성과 속임수와 같은 핵심 위험을 대상으로 표준화된 능력 평가를 개발할 것을 제안합니다.

이 프레임워크는 위험 기반 배포 파이프라인을 제안합니다:

  • 위험 기준 설정: 연구 및 자금 지원을 통해 특정 위험 기준을 정의해야 합니다.
  • 기준 이하: 이 기준 이하의 모델은 기존 안전 기준 준수를 확인한 후 배포할 수 있습니다.
  • 기준 이상: 위험 기준을 초과하지만 충분한 안전 완화 조치가 없는 모델은 배포를 중단하고 감독을 강화하며, 규제 기관에 통보하여 필요한 보호 조치를 결정해야 합니다.

대규모 학습 실행 사전 등록

Anthropic은 AI 개발자가 학습을 시작하기 전에 국가 정부에 대규모 학습 실행의 세부 사항을 기밀로 사전 등록할 수 있는 등록 시스템을 제안합니다. 이 등록 시스템은 다음을 추적합니다:

  • 모델 사양 및 유형
  • 계산 인프라
  • 예상 학습 완료 일자
  • 안전 계획

이 과정은 모델이 생성되기 전에 잠재적 위험에 대해 규제 기관이 인지할 수 있도록 하며, 집계된 데이터는 높은 사이버 보안 및 개인정보 보호 기준으로 보호됩니다.

외부 감사 및 레드팀 활동

안전성 주장의 타당성을 검증하기 위해, Anthropic은 외부 레드팀 활동을 의무화하고 제3자 감사 기관의 권한을 강화할 것을 권고합니다.

제3자 감사 기관의 요건

감사 기관이 효과적으로 기능하기 위해 세 가지 특정 특성이 필요합니다:

  1. 기술적 이해력: 심층적인 머신러닝 경험
  2. 보안 인식: 국가 안보 위협이 될 수 있는 민감한 지적재산권을 보호할 수 있는 능력
  3. 유연성: 미국의 경쟁력을 해치지 않으면서 위협을 식별할 수 있는 가벼운 평가를 수행할 수 있는 능력

외부 레드팀 활동

고급 AI 시스템을 배포하기 전에 외부 레드팀 활동을 전제 조건으로 삼아야 합니다. Anthropic은 이를 NIST와 같은 중앙 기관이 관리하거나 연구자들이 API 접근을 통해 분산된 방식으로 운영하는 방식으로 추진할 것을 제안합니다. 회사는 이 조치가 의무화되기 전에 고품질의 레드팀 활동 옵션이 확보되어야 한다고 강조하며, 현재 필요한 인재는 주로 사내 연구소에 집중되어 있다고 지적합니다.

해석 가능성 및 산업 협력

Anthropic은 정부 보조금을 통해 대학, 비영리 단체 및 기업의 해석 가능성 연구를 강화할 것을 촉구합니다. 이를 통해 선도 연구소 외부에서 더 작은 모델을 대상으로 안전성 작업을 수행할 수 있습니다.

또한, 이 제안은 두 가지 체계적 장애물을 다룹니다:

  • 규제의 실현 가능성: Anthropic은 완전히 해석 가능한 모델을 요구하는 규제는 현재 실현 불가능하지만, 연구가 진전됨에 따라 가능해질 수 있다고 지적합니다.
  • 반독점법 명확성: 규제 기관은 AI 기업들이 공공의 이익을 위해 안전성에 대해 협력할 수 있도록 반독점법 위반 없이 명확한 지침을 제공해야 하며, 이는 산업 협력에 대한 법적 불확실성을 줄입니다.

Sources

관련