앤트로픽 책임 있는 규모 확장 정책
앤트로픽은 책임 있는 규모 확장 정책(RSP)을 발표했다. 이 정책은 점점 더 강력한 AI 시스템 개발과 관련된 치명적 위험을 관리하기 위해 기술적 및 조직적 절차를 통합한 프레임워크이다. 이 정책은 안전성 및 보안 조치가 실제로 효과가 있음을 입증한 경우에만 AI 능력을 확장하는 체계적인 접근을 설정한다.
AI 안전 수준(ASL) 프레임워크
앤트로픽의 RSP는 미국 정부의 생물안전 수준(BSL) 기준을 모델로 삼은 AI 안전 수준(ASL) 시스템에 기반한다. 이 프레임워크는 모델의 치명적 위험 가능성에 비례해 안전성, 보안성, 운영 기준이 함께 확장되어야 한다고 요구한다.
ASL 정의 및 기준
- ASL-1: 의미 있는 치명적 위험이 없는 시스템. 예를 들어 2018년 LLM이나 체스를 전용으로 하는 AI 시스템.
- ASL-2: 위험한 능력의 초기 징후를 보이는 시스템(예: 생물무기 제조 방법에 대한 지침 제공). 그러나 정보의 신뢰성이 낮거나 검색 엔진을 통해 이미 공개된 정보이기 때문에 아직 유용하지 않음. 현재의 LLM, 클로드를 포함한 모든 시스템은 ASL-2로 분류된다.
- ASL-3: 비AI 기준(예: 교과서나 검색 엔진)보다 치명적 오용 위험이 크게 증가하거나, 저수준의 자율 능력을 보이는 시스템.
- ASL-4 및 ASL-5+: 현재 시스템 능력과 거리가 멀어 아직 정의되지 않았지만, 자율성과 치명적 오용 가능성의 질적 증가를 포함할 것으로 예상된다.
안전 조치 및 구현
모델의 ASL 수준이 높아질수록 안전 요구사항이 더욱 엄격해진다. ASL-2 조치는 앤트로픽의 이전 화이트하우스 약속과 일치한다. ASL-3는 더 엄격한 기준을 요구하며, 보안 요구사항 강화와 세계 최고 수준의 레드팀이 치명적 오용 위험을 시험할 때 의미 있는 위험을 보일 경우 모델을 배포하지 않겠다는 약속을 포함한다.
ASL-4에 대해서는, 앤트로픽은 ASL-3에 도달하기 전에 조치를 정의할 것을 약속한다. 이러한 조치는 현재 해결되지 않은 연구 문제를 해결하는 것을 포함할 수 있으며, 예를 들어 해석 가능성 기법을 사용해 모델이 치명적 행동을 취할 가능성이 낮음을 기계적으로 입증하는 것 등이 있다.
운영 및 비즈니스 영향
RSP는 위험 완화와 유익한 AI 응용 프로그램 개발 사이의 균형을 맞추기 위해 설계되었다. 더 강력한 모델의 훈련이 안전 절차를 준수할 능력을 초과할 경우, 일시적으로 훈련을 중단할 수 있는 메커니즘을 마련했다. 이 구조는 안전 문제 해결을 유도하여 추가적인 규모 확장을 가능하게 하기 위한 것이다.
비즈니스 측면에서 RSP는 클로드의 현재 사용 또는 가용성에 영향을 주지 않는다. 앤트로픽은 이 정책을 항공기나 자동차 산업의 시장 진입 전 테스트와 비교하며, 제품이 시장에 출시되기 전에 안전성이 철저히 입증되어야 한다고 설명한다.
거버넌스 및 반복 개선
앤트로픽의 RSP는 이사회에서 공식 승인되었으며, 정책 변경은 장기적 이익 신뢰기금과의 협의 후 이사회 승인을 받아야 한다. 이 정책은 초기 버전이며, AI 분야의 발전에 따라 빠른 수정을 통해 진화할 것으로 기대된다.
앤트로픽은 ARC Evals의 영향을 인정하며, 특히 AI 위험 평가 전문성과 ARC 책임 있는 규모 확장 정책 프레임워크 개발에 대해 언급했다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch