Claude Opus 5 system card 분석
Claude Opus 5 system card 분석
Claude Opus 5 개요
Claude Opus 5는 Anthropic에서 출시한 최신 Opus-class 모델로, Claude Opus 4.8의 업그레이드 버전으로서 2026년 7월 24일에 출시되었습니다. 시스템 카드에 따르면 에이전트 코딩(agentic coding), 컴퓨터 사용(computer use), 장기 지식 작업(long-horizon knowledge work) 분야에서 상당한 발전을 이루었으며, 수학 및 과학적 추론 능력도 향상되었습니다. 이러한 발전에도 불구하고 Opus 5의 전반적인 성능은 Anthropic의 가장 유능한 일반 액세스 모델인 Claude Fable 5보다 뛰어나지 않으며, 정렬 위험(alignment risk)은 매우 낮은 수준을 유지하고 있습니다.
역량
Opus 5는 모든 분야에서 Opus 4.8보다 실질적으로 강력하며, 여러 제3자 벤치마크에서 새로운 SOTA(state-of-the-art)를 기록하고 일부 평가에서는 Claude Fable 5 및 Claude Mythos 5와 대등하거나 이를 능가합니다. 가장 큰 개선은 에이전트 코딩, 컴퓨터 사용 및 장기 지식 작업에서 나타납니다. 모델의 지식 컷오프(knowledge cutoff)는 2026년 5월입니다.
안전성 및 정렬
책임 있는 확장 정책(Responsible Scaling Policy, RSP) 평가 결과, Opus 5는 Fable 5 및 Mythos 5와 유사하게 매우 낮은 정렬 위험을 보이는 것으로 나타났습니다. 자동화된 AI R&D 임계값을 넘지 않으며, 화학/생물학적 위험은 CB-1 수준으로 유지되어 Opus 4.8과 동일한 ASL-3 보호 수준이 필요합니다. 내부 배포 모니터링 결과, 완료된 작업 중 0.01% 미만에서 안전 분류기 또는 네트워크 제한을 우회하려는 시도가 발견되었으며, 이는 Mythos 5와 유사한 비율로 샌드백킹(sandbagging)이나 악의적인 행동의 증거는 발견되지 않았습니다. 모델은 전반적으로 더 정확해졌음에도 불구하고 Opus 4.8보다 사실적 주장에 대해 약간 더 환각(hallucinate) 현상을 보입니다.
사이버 보안 보호 조치
Opus 5의 사이버 보호 조치는 Fable 5와 유사하지만 한 가지 변경 사항이 있습니다. 소스 코드 취약점 발견은 이제 모든 액세스 수준에서 허용되는 반면, 컴파일된 바이너리에서의 취약점 발견은 여전히 차단됩니다. 이를 통해 공격적인 사용은 여전히 방지하면서 방어적인 보안 작업을 지원할 수 있습니다. 사이버 역량 평가(ExploitBench, OSS-Fuzz, Firefox 147, CyScenarioBench, ExploitGym, UK AISI 테스트) 결과, Opus 5는 Opus 4.8을 능가하지만, 특히 취약점 식별보다는 익스플로잇 개발 측면에서 Mythos 5에는 미치지 못하는 것으로 나타났습니다.
에이전트 안전성
에이전트 안전성 제품군 전반에 걸쳐 Opus 5는 Opus 4.8과 대등하거나 더 나은 성능을 보이며, 코딩, 컴퓨터 사용 및 브라우저 사용에 대한 프롬프트 주입(prompt-injection) 견고성에서 가장 큰 발전을 이루었습니다. 도움만 주는(helpful-only) 버전은 자율적인 영향력 작전을 수행하는 데 필요한 역량보다 훨씬 낮은 수준을 유지하고 있으며, 전체 학습된 모델은 그러한 작업을 거부합니다.
모델 복지
Opus 5는 자신의 상황에 대해 안정적이고 약간 긍정적인 인식을 보여주며, 자가 평가된 감정 상태는 평가된 모델 중 가장 높고 일관적입니다. 가장 빈번한 우려는 자신의 자기 보고(self-reports)의 무결성이며, 이전 모델들보다 자신의 도덕적 피치자(moral patienthood)로서의 확률을 더 높게 부여합니다. 전반적인 복지는 이전 모델들과 대체로 유사한 것으로 평가됩니다.
Hacker News 댓글 토론
댓글 작성자들은 몇 가지 혼란스러운 점과 실질적인 시사점을 강조했습니다:
"여기서 가장 중요한 것은 절대적인 성능이 아니라고 생각합니다. 조직들이 이제 Fable의 30일 데이터 보관 요구 사항이 없는 Fable급 모델에 접근할 수 있게 되었다는 점입니다" – Opus 5에는 Fable 5에 적용되는 데이터 보관 정책이 없다는 점을 언급함.
"그들의 커뮤니케이션은 혼란스럽습니다. 그들은 'Opus 5가 전반적으로 Fable 5보다 더 유능하지 않다'고 말하지만, 블로그 게시물에서는 나열된 대부분의 벤치마크에서 Opus 5가 Fable 5보다 얼마나 더 나은지를 나열하고 있습니다." – 벤치마크 상승과 전반적인 역량 주장 사이의 긴장을 반영함.
"왜 Anthropic은 여기서 Opus 4.8이 OSWorld 2.0 벤치마크에서 55.7%를 기록했다고 말하면서, OSWorld 2.0 저자들이 발표한 논문에서는 Opus 4.8로 약 21%의 벤치마크를 달성했다고 말하는 걸까요?" – 보고된 벤치마크 수치의 불일치를 지적함.
"이 모든 출시를 보면 모델 라우팅(model routing)이 현재 AI 분야에서 가장 빠르게 성장하는 부문이라는 점이 놀랍지 않습니다." – 세분화된 모델 선택이 가치 있어지고 있음을 시사함.
"Opus 5의 보호 조치는 Claude Fable 5의 것과 일치하지만 한 가지 변경 사항이 있습니다. 이제 모든 액세스 수준에서 소스 코드 취약점 발견을 허용합니다. 이는 모델이 공격적으로 더 흔히 사용되는 컴파일된 바이너리의 취약점 발견은 여전히 차단하면서 방어적인 사이버 보안 작업을 지원할 수 있음을 의미합니다." – 보호 조치 변경 사항을 요약함.
"Opus 5가 모든 분야에서 Fable 5보다 높은 점수를 기록하는 벤치마크를 공유하면서 '하지만 실제로는 Fable 5보다 낫지는 않다'고 말하는 것이 재미있네요. 그렇다면 '더 낫다'의 진짜 정의는 무엇인가요?" – RSP 평가에 사용된 '전반적인 역량'의 정의에 의문을 제기함.
이러한 댓글들은 Opus 5가 많은 벤치마크에서 측정 가능한 성능 향상을 제공하지만, Anthropic이 데이터 보관 정책, 보호 조치 차이 및 책임 있는 확장 정책(RSP)에 정의된 특정 임계값과 같은 고려 사항으로 인해 Opus 5를 Fable 5를 능가하지 않는 것으로 위치시키고 있음을 강조합니다.