Claude Opus 4.8: 증가된 성과, 에이전트적 야망, 그리고 'Effort' 딜레마

Anthropic은 Claude Opus 4.8을 공식적으로 출시했습니다. 이는 가장 강력한 모델의 개선된 반복 버전입니다. 회사는 이를 Opus 4.7에 비해 '작지만 구체적인 개선'이라고 설명하지만, 이 업데이트는 에이전트 워크플로우로의 전략적 전환을 알립니다—여기서 AI는 단순히 질문에 답하는 것이 아니라 복잡하고 다단계 작업을 자율적으로 수행합니다.

핵심 초점: 신뢰성과 '정직성'

Anthropic에 따르면, Opus 4.8의 주요 도약은 원시적인 지능이 아니라 판단에서의 신뢰성입니다. 이 모델은 더 '정직하게' 설계되어 증거가 부족할 때 자신 있게 진행 상황을 주장할 가능성이 낮고, 불확실성을 플래그할 가능성이 더 높습니다.

Anthropic은 Opus 4.8이 전작보다 약 4배 낮게 자신의 코드 결함이 지나가도록 허용할 가능성이 있다고 주장합니다. 이 변화는 '에이전트' 작업에 중요합니다—여기서 모델은 에이전트로 작동합니다(예: 브라우저 또는 터미널 사용)와 캐스케이딩 실패를 피하기 위해 스스로 수정해야 합니다.

실제 세계 성능

산업 파트너들의 초기 피드백에서 몇 가지 주요 개선 영역이 강조됩니다:

  • 법률 및 금융 업무: CoCounsel과 Hebbia와 같은 파트너들은 고위험 전문 워크플로우에서 인용 정확도가 향상되고 추론 품질이 높아졌다고 보고합니다.
  • 엔터프라이즈 데이터: Databricks는 자신의 Genie AI에 대한 에이전트적 추론에서 '단계적 변화'를 언급했는데, 구체적으로 PDF와 다이어그램과 같은 비구조화된 콘텐츠에 대한 추론에서 그렇습니다.
  • 코딩: 테스터들은 Opus 4.8이 더 반성적이라고 보고했는데, 자신의 실수를 포착하고 큰 변경을 실행하기 전에 타당한 계획에 반대합니다.

새로운 기능: Effort Control과 Dynamic Workflows

아마도 가장 많이 논의된 추가 기능은 claude.ai에서의 Effort Control 도입입니다. 사용자는 이제 Claude가 응답에 투입하는 'effort'의 양을 low에서 'max'(또는 Claude Code에서의 'xhigh')까지 선택할 수 있습니다.

  • Low Effort: 더 빠른 응답과 속도 제한 소비의 느림.
  • High/Max Effort: 모델은 더 깊고 자주 생각하며, 더 높은 품질의 결과를 얻기 위해 더 많은 토큰을 소비합니다.

이에 더불어, Anthropic은 Claude Code를 위한 Dynamic Workflows를 도입했습니다. 이 연구 프리뷰는 모델이 대규모 작업을 계획하고 단일 세션에서 수백 개의 병렬 서브 에이전트를 배포할 수 있게 합니다. Anthropic은 동적 워크플로우가 Zig에서 Rust로 Bun 런타임을 포팅하는 데 사용된 주목할 만한 사용 사례를 강조합니다.

커뮤니티 반응: 'Incrementalism' 논쟁

프론티어 모델 업데이트에서는 흔히 그렇듯, Hacker News 커뮤니티가 나뉩니다. 일부 사용자는 Opus 4.7이 해결하지 못했던 드문 동시성 버그 수정과 같은 상당한 승리를 보고하는 반면, 다른 사용자는 'model épuisement'을 표현합니다.

증가주의의 경우

일부 사용자는 새로운 모델의 솔직함을 높이 평가합니다. 한 사용자는 다음과 같이 언급했습니다: "나는 그 모델이 사용하는 직설적인 솔직함을 정말 좋아합니다... 실패한 곳과 gaps가 있는 곳을 바로 알려줍니다."

반대 의견

비평가들은 이익이 너무 작아서 변화를 정당화하기 어렵다고 주장합니다. 일부 사용자는 'effort' 설정이 과도하게 세분화되고 모호하다고 느껴서 모델을 일관되게 벤치마크하기 어렵다고 느낍니다. 다른 사용자들은 GPT-5.5와의 경쟁 심화와 DeepSeek 같은 중국 모델들의 공격적인 가격 인하가 Anthropic의 가치 proposition에 위협이 된다고 지적합니다.

"최근의 것들은 흥분하거나 워크플로우를 바꾸기에는 너무 미미합니다. 이 시점에서 저는 거의 Anthropic이 기다렸다가 정말로 5.0 출시로 우리를 놀라게 해주기를 바랍니다." — @dudeinhawaii

기술적 마찰과 버그

성능 향상에도 불구하고, 출시는 기술적 결함으로 얼룩졌습니다. 여러 사용자가 Claude Code에서 'thinking blocks'와 관련된 반복적인 API Error 400를 보고했는데, 이는 시스템이 최신 어시스턴트 메시지의 reasoning blocks를 수정하려고 할 때 실패합니다. 이로 인해 일부 개발자는 도구의 이전 버전으로 일시적으로 복귀하게 되었습니다.

미래 전망: Project Glasswing과 Mythos

Anthropic은 다음 전선을 암시했습니다: Project Glasswing. 일부 조직은 이미 전문 사이버 보안 작업을 위해 'Claude Mythos Preview'를 사용하고 있습니다. Anthropic은 Mythos-클래스 모델이 Opus를 넘어선 지능 수준을 가지고 있지만, 일반 출시 전에 더 stringent한 사이버 보호 조치가 필요하다고 나타냅니다. 이러한 높은 지능 모델은 앞으로 몇 주 내에 모든 고객에게 제공될 것으로 예상됩니다.

가용성 및 요금 요약

Opus 4.8은 이제 Claude API와 claude.ai를 통해 이용할 수 있습니다. 요금은 Opus 4.7과 일관되게 유지됩니다:

  • Standard: $5/M 입력, $25/M 출력
  • Fast Mode: $10/M 입력, $50/M 출력 (2.5x 속도 제공)

Sources