Google DeepMind Frontier Safety Framework 업데이트

Google DeepMind는 Frontier Safety Framework(FSF)를 세 번째 버전으로 업데이트했으며, 위험 영역을 확대하고 고도화된 AI 모델로 인한 심각한 위험을 완화하기 위한 평가 프로세스를 정교화했습니다. 이번 업데이트는 해로운 조작 탐지를 실제 운영에 적용하고, AI 기반 연구·개발과 관련된 정렬 불일치 위험을 다루는 데 초점을 맞춥니다.

해로운 조작을 위한 새로운 Critical Capability Level

Google DeepMind는 해로운 조작을 위한 **Critical Capability Level (CCL)**을 새롭게 도입했습니다. 이 CCL은 AI 모델이 고위험 상황에서 신념과 행동을 체계적·대규모로 바꿀 수 있는 조작 능력을 보유했을 때 발동되며, 이는 심각한 규모의 피해를 초래할 수 있습니다. 이 항목은 생성형 AI에서 조작을 일으키는 메커니즘에 대한 연구를 기반으로 추가되었습니다.

정렬 불일치 및 AI 연구 위험 대응

업데이트된 프레임워크는 정렬되지 않은 AI 모델이 운영자의 지시, 수정, 혹은 시스템 종료 능력을 방해할 수 있는 시나리오를 다루도록 범위를 확대했습니다.

정렬 불일치 접근 방식의 주요 변화는 다음과 같습니다:

  • Instrumental Reasoning에서의 전환: 프레임워크는 기만적 사고에 대한 경고 수준인 Instrumental Reasoning CCL에 초점을 맞춘 탐색적 접근에서 벗어나, AI 연구·개발을 불안정한 수준으로 가속화할 수 있는 모델에 대한 프로토콜로 전환합니다.
  • 위험 통합: 이제 모델이 의도되지 않은 행동을 할 가능성과 이러한 모델이 배포 과정에 통합될 때 발생하는 정렬 불일치 위험을 고려합니다.
  • 확장된 Safety Case 검토: 위험이 관리 가능한 수준으로 감소했음을 입증하는 상세 분석인 Safety Case 검토가 외부 출시뿐 아니라 고도화된 머신러닝 연구·개발 CCL에 도달했을 때 대규모 내부 배포에도 요구됩니다.

정교화된 위험 평가 및 거버넌스

Google DeepMind는 Critical Capability Level (CCL) 정의를 더욱 명확히 하여 가장 엄격한 거버넌스가 필요한 핵심 위협을 식별합니다. 모델 개발 전반에 표준 안전·보안 완화 조치가 적용되는 반면, CCL은 강화된 완화 전략을 트리거합니다.

위험 평가 프로세스에 이제 포함되는 항목은 다음과 같습니다:

  • 체계적인 위험 식별.
  • 모델 능력에 대한 포괄적 분석.
  • 위험 수용 가능성에 대한 명시적 판단.

Tracked Capability Levels 도입 (FSF 3.1)

2026년 4월 17일부로 Google DeepMind는 특정 영역에서 Tracked Capability Levels (TCLs) 를 도입했습니다. TCL은 CCL보다 덜 극단적인 잠재 위험을 식별·평가하도록 설계되어, 개발 주기 초기에 위험을 발견하고 완화할 수 있게 합니다.

증거 기반 안전에 대한 약속

Frontier Safety Framework는 이해관계자 의견, 새로운 연구, 구현 경험을 바탕으로 지속적으로 진화하도록 설계되었습니다. Google DeepMind는 이 프레임워크가 인공지능 일반화(AGI)로 향하는 과정에서 능력이 향상될수록 혜택을 실현하면서도 해를 최소화하도록 목표한다는 입장을 밝혔습니다.

Sources