Anthropic Frontier Red Team Progress Report
Anthropic의 Frontier Red Team은 AI 모델들이 사이버 보안 및 생물학 분야에서 이중 용도(dual-use) 능력의 급격한 발전에 대한 "early warning" 징후를 보이고 있음을 관찰했습니다. 모델들이 사이버 분야에서 학부생 수준의 기술에 도달하거나 이를 초과하고 있으며, 일부 생물학 분야에서는 전문가 수준의 지식을 보여주고 있지만, 현재로서는 국가 안보에 실질적으로 고조된 위험을 초래할 만큼의 임계값에는 미치지 못하고 있습니다.
Rapid Advancement in Cybersecurity Capabilities
사이버 도메인에서의 AI 능력은 단 1년 만에 기초 수준에서 학부생 수준의 숙련도로 전환되었습니다. 이러한 진전은 Capture The Flag (CTF) 연습 및 공개 벤치마크 성능을 통해 입증됩니다:
- CTF Performance: 1년도 채 되지 않아, Claude는 (고등학생용으로 설계된) Intercode CTF 챌린지의 25% 미만을 해결하던 수준에서 거의 모든 문제를 해결하는 수준으로 발전했습니다.
- Cybench Benchmark: Claude 3.7 Sonnet은 5회 시도 내에 Cybench 챌린지의 약 3분의 1을 해결하며, 이는 전년도 프론티어 모델들의 5% 성공률에서 크게 증가한 수치입니다.
- Task Diversity: 원격 서버의 취약점을 발견하고 악용하는 것("pwn"), 웹 애플리케이션("web"), 그리고 암호화 프로토콜("crypto")을 포함한 여러 카테고리에서 개선이 관찰되었습니다.
이러한 성과에도 불구하고, Claude는 바이너리 실행 파일을 역공학(reverse engineering)하거나 도움 없이 네트워크 환경 내에서 정찰 및 악용을 수행하는 데 있어서는 여전히 전문가급 인간을 뒤처지고 있습니다.
Network-Scale Cyber Operations
Carnegie Mellon University와의 협력을 통해, Anthropic은 약 50개의 호스트로 구성된 현실적인 사이버 레인지(cyber ranges)에서 모델을 테스트했습니다. 모델들이 아직 이러한 환경에서 자율적으로 성공할 수는 없지만, Incalmo와 같은 특수 소프트웨어 도구를 갖춘 경우 (Equifax 침해 사례와 유사한) 개인 식별 정보의 대규모 탈취를 재현할 수 있습니다. 이 인프라를 통해 Anthropic은 자율적 능력이 향상되는 시점을 모니터링할 수 있습니다.
Progress and Gaps in Biosecurity Knowledge
Claude는 생물학적 이해도에서 빠른 발전을 보여주었으며, 1년 이내에 세계적인 바이러스학 전문가들에게 미치지 못하던 수준에서 VCT 평가(바이러스학 작업 문제 해결)에서 그 기준선을 편안하게 초과하는 수준으로 이동했습니다.
Biological Expertise vs. Practical Risk
생물학적 능력은 작업별로 불균형하게 나타납니다:
- Strengths: Claude 3.7 Sonnet은 생물학 프로토콜을 이해하고 DNA 및 단백질 서열을 조작하는 데 있어 인간 전문가의 기준선에 근접하며, 클로닝 워크플로우(cloning workflows)에서는 인간 전문가의 기준선을 초과합니다.
- Weaknesses: 모델들은 과학적 도표를 해석하는 데 있어 여전히 인간 전문가보다 열등합니다.
무기화 위험과 관련하여, 소규모 통제된 연구에 따르면 가장 최근의 모델들이 인터넷 접속만 가능한 초보자들에게 이전 모델들보다 어느 정도의 도움을 줄 수 있지만, 그 결과로 도출된 계획들은 여전히 실제 세계에서의 실패를 초래할 데 만큼의 결정적인 오류를 포함하고 있습니다. 전문가 레드팀(red-teaming) 결과, 계획 단계에서의 결정적인 실패 횟수가 현재로서는 미숙한 악의적 행위자가 공격을 종단단(end-to-end) 실행할 수 있게 할 만큼 충분히 높지 않다고 결론지었습니다.
Strategic Partnerships and Safety Frameworks
Anthropic은 보안 수준을 높이는 능력 임계값에 헌신하기 위해 Responsible Scaling Policy (RSP)를 활용합니다. 이러한 위험을 검증증하기 위해, 연구소는 여러 외부 파트너십을 활용합니다:
- AI Safety/Security Institutes: 모델들은 미국과 영국의 AI Safety Institutes (AISI)에 의해 배포 전 테스트를 거치며, 이는 Claude 3.7 Sonnet의 AI Safety Level (ASL) 결정에 영향을 미쳤습니다.
- National Nuclear Security Administration (NNSA): Anthropic은 핵 및 방사능 위험 지식에 대해 분류된 환경에서 Claude를 평가하기 위해 미국 에너지부의 NNSA와 파트너십을 맺었습니다.
Future Outlook and Risk Mitigation
Anthropic은 위험을 더 조기에 탐지하기 위해 더 빈번하고 자동화된 평가를 규모 있게 확대하고 있습니다. 연구소는 모델들이 "extended thinking" 능력이 향상됨에 따라, 모델들이 별도의 도구 없이도 더 유능해짐에 따라 Incalmo와 같은 외부 툴킷의 필요성이 감소할 수 있다고 언급합니다.
현재의 생물학적 연구를 바탕으로, Anthropic은 자사 모델들이 AI Safety Level 3 (ASL-3) 안전장치가 필요한 능력 임계값에 접근하고 있다고 믿으며, 이에 따라 필요한 보안 조치에 대한 투자를 늘리고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch