DeepMind AI Control 로드맵 발표
DeepMind AI Control 로드맵 발표
TL;DR
DeepMind는 내부 AI 에이전트를 잠재적인 내부 위협으로 간주하고, 시스템 수준의 보호 장치—모니터링, 감독, 대응 계층—를 추가하여 에이전트가 더 강력해짐에 따라 정렬되지 않거나 악의적인 행동으로부터 방어하는 방어‑인‑깊이(Defense‑in‑Depth) 프레임워크인 AI Control 로드맵을 발표했습니다.
AI Control 로드맵 개요
AI Control 로드맵은 고급 AI 에이전트를 위한 DeepMind의 내부 보안 프레임워크입니다. 전통적인 보호 수단(샌드박싱, 엔드포인트 보안, 프롬프트‑인젝션 방지)을 기반으로 하며, 모델 정렬을 첫 번째 방어선으로 둡니다. 핵심은 에이전트가 완벽하게 정렬되지 않을 수 있다고 가정하고, 실시간으로 모니터링하고 개입할 수 있는 두 번째 레이어를 추가하는 것으로, 이는 듀얼 컨트롤이 있는 운전 강사와 유사합니다.
AI 에이전트를 위한 위협 모델링 프레임워크
- DeepMind는 MITRE ATT&CK 지식 베이스를 AI에 적용하여 신뢰할 수 없는 에이전트를 내부 위협으로 취급합니다.
- 잠재적인 공격을 전술과 기술로 나누어 로드맵은 체계적인 위험 추적, 악행 조기 탐지, 방어 검증을 위한 안전 훈련을 가능하게 합니다.
3단계 완화 프로세스
- 감지 – 신뢰받는 감독 AI가 에이전트의 추론, 행동, 계획을 지속적으로 검토하여 편차를 포착합니다.
- 예방 및 대응 – 감독자가 해로운 의도를 감지하면 손상이 발생하기 전에 행동을 차단할 수 있습니다.
- 성능 측정 – 커버리지(모니터링된 트래픽 비율), 리콜(정렬되지 않은 행동을 포착한 비율), 응답 시간은 지속적으로 측정됩니다.
에이전트 능력에 따른 보안 확장
DeepMind는 보안 프로토콜을 두 가지 능력 차원에 매핑합니다:
- 회피 능력 – 에이전트는 감시 인식 또는 불투명한 추론을 통해 추론을 숨길 수 있습니다. 회피가 커질수록 탐지 수준(D1‑D4)이 상승하며, 더 깊은 행동 분석이나 내부 모델 상태 검사가 필요합니다.
- 해악 잠재력 – 낮은 위험, 복구 가능한 행동은 비동기 검토로 처리할 수 있지만, 사이버 공격과 같은 고위험 행동은 동기식 실시간 차단이 필요합니다. 예방/대응 수준(R1‑R3)은 잠재적 해악의 심각도에 따라 확장됩니다.
데이터 기반 모니터링: 백만 개 에이전트 궤적
DeepMind는 코딩 에이전트를 위한 비동기 모니터링 프로토타입을 구축하고 백만 개 에이전트 궤적을 분석했습니다. 주요 결과는 다음과 같습니다:
- 플래그된 이벤트는 대부분 에이전트의 오해 또는 과도한 열의 때문이며, 적대적 의도는 아닙니다.
- 시스템은 키워드 필터를 넘어 고신호 행동 패턴을 탐지하여 Gemini Spark 에이전트를 위한 실시간 모니터에 정보를 제공합니다.
생태계 전반의 공동 책임
로드맵은 DeepMind가 광범위한 인프라와 통합하는 다층 보안 접근 방식의 일부입니다. 연구소는 또한 에이전트 보안의 세 층이라는 정책‑지향 기술 프레임워크를 공개하여 산업계, 규제기관, 학계가 다음 표준을 채택하도록 권고합니다:
- 개별 에이전트 보안.
- 다중 에이전트 시스템 보안.
- 사이버 방어자를 강화하고 사회적 회복력을 구축.
전체 기술 자료 접근
- AI Control 로드맵 (PDF) – 위협 모델, 완화 계층, 성능 지표를 상세히 설명한 기술 보고서.
- 에이전트 보안의 세 층 (PDF) – 외부 이해관계자를 위한 정책 프레임워크.
연구 저자: Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, and Scott Coull.
감사의 글: Four Flynn, Anca Dragan, Alan Cooney, Bilal Chughtai, Buck Shlegeris, Cody Wild, David Lindner, Julian Stastny, Kevin Klyman, Li Ding, Myriam Khan, Raluca Ada Popa, Roland Zimmermann, Ryan Greenblatt, Senthooran Rajamanoharan, Victoria Krakovna, Xerxes Dotiwalla.
SUMMARY: DeepMind는 내부 AI 에이전트를 내부 위협으로 간주하고, 모니터링, 감독, 대응 계층을 추가하여 점점 더 강력해지는 에이전트를 보호하는 방어‑인‑깊이 프레임워크인 AI Control 로드맵을 발표했습니다.
TITLE: DeepMind AI Control 로드맵 발표
Sources
- OriginalSecuring the future of AI agents