앤트로픽 책임 있는 스케일링 정책 버전 3.0
앤트로픽은 AI 능력이 발전함에 따라 치명적인 위험을 완화하기 위해 설계된 자발적 프레임워크인 책임 있는 스케일링 정책(RSP)의 버전 3.0을 발표했습니다. 이번 업데이트는 엄격한 '만약-그러면' 능력 기준에서 벗어나, 앤트로픽이 단독으로 달성할 수 있는 것과 산업 전체 또는 정부의 공동 행동이 필요한 것을 구분하는 더 현실적인 접근법으로 전환했습니다.
구조적 전환: 단독 대응 vs. 다자적 대응
앤트로픽은 RSP의 내부 운영 계획과 AI 산업 전반에 대한 보다 포괄적인 안전 권고를 분리하기 위해 정책을 재구성했습니다. 이 변화는 일부 고위 안전 장치가 단일 기업이 독자적으로 구현하기 어려운 현실을 반영합니다.
- 단독 약속: RSP는 이제 다른 산업 참여자와 무관하게 앤트로픽이 독자적으로 추진할 구체적인 완화 조치를 명시합니다.
- 산업 권고: 정책은 전체 AI 산업이 고도화된 위험을 공동으로 관리할 수 있는 청사진으로서, 능력 수준에 따른 완화 조치 매핑을 포함합니다.
프론티어 안전 로드맵
버전 3.0은 프론티어 안전 로드맵(Frontier Safety Roadmap)을 도입했습니다. 이는 보안, 정렬, 안전 장치, 정책의 네 가지 핵심 분야에서 도전적이지만 달성 가능한 목표를 담은 공개 문서입니다. 이러한 목표는 구속력이 없지만, 내부 추진력과 진전을 위한 공개 기준으로 기능합니다.
로드맵 내 주요 목표는 다음과 같습니다:
- 정보 보안: 사전에 없던 수준의 보안을 달성하기 위한 '문명 수준의 연구개발'(moonshot R&D) 프로젝트를 시작합니다.
- 자동화된 레드팀: 인간 버그 바운티 참여자보다 더 뛰어난 효과를 발휘하는 자동화된 레드팀 기법을 개발합니다.
- 헌법 준수: 모델이 앤트로픽의 헌법에 따라 행동하도록 체계적인 조치를 시행합니다.
- 내부 감시: 내부 위협(인간 및 AI 포함)과 보안 취약점을 탐지하기 위해 중요한 개발 활동의 중앙 집중식 기록을 구축합니다.
- 규제 지침: 위험 증가에 비례해 정책이 확장되는 '규제 계단'(regulatory ladder)을 제안하는 정책 로드맵을 공개합니다.
리스크 보고서 및 외부 검토
투명성을 높이기 위해 앤트로픽은 3~6개월마다 리스크 보고서(Risk Reports)를 체계적으로 발표할 계획입니다. 이러한 보고서는 현재 모델의 포괄적인 안전 프로파일을 제공하며, 능력, 위협 모델, 그리고 활성화된 완화 조치의 교차점을 상세히 설명합니다.
외부 검증
특정 상황에서는 RSP가 이제 리스크 보고서의 외부 검토를 요구합니다. 앤트로픽은 AI 안전 연구에 익숙하고 이해관계가 없는 제3자 전문가를 지명하여, 수정되지 않은 보고서에 접근하고 회사의 논리와 의사결정을 공개적으로 검토하도록 할 것입니다. 현재 모델은 이 요구 사항을 충족하지는 않지만, 앤트로픽은 현재 이 프로세스를 시범 운영 중입니다.
회고: RSP v1과 v2의 성공과 실패
앤트로픽의 버전 3.0 전환은 이전 정책에 대한 2년 반에 걸친 평가를 바탕으로 합니다.
성공한 점
- 내부 동기 부여: RSP는 ASL-3(AI Safety Level 3) 기준 준수를 위해 사용되는 입력 및 출력 분류기와 같은 더 강력한 안전 장치 개발을 강제하는 데 성공했습니다.
- 산업 영향력: 이 프레임워크는 오픈AI와 구글 딥마인드를 포함한 다른 연구소들이 유사한 안전 프레임워크를 채택하도록 유도했으며, 캘리포니아(SB 53), 뉴욕(RAISE Act), 유럽연합(AI Act의 실천 가이드라인) 등에서 초기 AI 정책 수립에 영향을 미쳤습니다.
실패한 점
- 능력 기준: '모호성의 영역'으로 인해 특정 능력 기준을 통과했는지 정확히 판단하기 어려웠습니다. 예를 들어 생물학적 위험 분야에서 모델은 간단한 테스트를 통과할 수 있지만, 고위험을 확실히 입증하지는 못해 다자적 행동을 위한 근거를 마련하기 어렵습니다.
- 정부의 속도: AI 안전에 대한 정부의 대응은 예상보다 느렸으며, 정치적 분위기는 경제 성장과 경쟁력 강화를 안전 규제보다 우선시하는 경우가 많았습니다.
- 단독 한계: 일부 고위 보안 기준(예: RAND 보고서에서 언급된 'SL5' 기준)은 국가 안보 공동체의 지원 없이는 현재로서는 달성 불가능하다고 판단됩니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch