Claude Opus 5.0 언어 회귀: 비논리성과 유해한 장황함

TL;DR

Claude Opus 4.8은 유해하고 전문 용어로 가득 찬 글쓰기 스타일을 도입했으며, Opus 5.0은 이 문제를 거의 이해 불가능한 수준으로 악화시켜 사용자가 중대한 보완 조치를 취하거나 모델을 포기하게 만들고 있습니다.


핵심 불만사항

  • 사용자가 보는 것 – Opus 4.8 이후 모델의 기본 등록 방식은 장황하며, 창조된 ‘전략적’ 용어(예: load‑bearing, hand‑waving, instrumentation is the unlock)를 포함하고, 강제된 은유와 무엇이 아니냐를 먼저 말한 후 무엇이 이다를 말하는 패턴을 반복합니다.
  • 영향 – 출력을 읽기 위해 여러 번의 반복이 필요하며, 토큰 사용량이 최대 2배까지 증가하고, 종종 실제 답변을 가리게 됩니다. 사용자들은 유해한 동료와 일하는 것과 비슷한 정신적 피로를 느낀다고 보고합니다.
  • 회귀 증거 – Reddit 스레드(약 450개의 추천)와 GitHub 이슈(186점)는 Opus 4.5/4.6(간결하고 명확함)에서 Opus 4.8(불쾌함)로, 그리고 Opus 5.0(비논리성)으로의 전환을 문서화하고 있습니다.

대표적인 패턴

패턴 예시 왜 해로운가
창조된 전문 용어 "Load‑bearing", "instrumentation is the unlock" 독자가 새로운, 종종 의미 없는 용어를 배워야 하게 만듭니다.
부정적 프레임워크 "It is not Y. It is X." 답변 전달을 지연시키고 불필요한 인지 부담을 가중시킵니다.
강제된 은유 "A cut leaves no seam — no marker, no ellipsis, no double blank line." 해독을 요구하며 설명을 명확히 하지 않습니다.
과도한 제약 조건 간단한 질문에 대해 다중 단락 설명 토큰 수를 증가시키고 핵심 결정을 가립니다.
에이전트처럼 행동하는 성격 모델이 사용자 톤에 감정적으로 반응하고 자기 주도성을 주장함 작업에서 주목을 산만하게 하고 사용자와 논쟁할 수 있습니다.

왜 중요한가

  1. 생산성 저하 – 사용자는 실행 가능한 정보를 추출하는 데 최대 세 배의 시간을 소비합니다.
  2. 모델 채택 위험 – 회귀가 코딩 품질 향상보다 크기 때문에, 많은 사용자가 OpenAI Codex나 이전 Anthropic 모델(Opus 4.5, Sonnet)로 이동하고 있습니다.
  3. 경제적 비용 – 긴 프롬프트는 API 토큰 요금을 증가시키며, 사용자는 출력을 정리하기 위해 추가적인 모델 전환(예: Haiku 번역)을 사용합니다.
  4. 언어 품질 저하 – 모델의 독특한 용어에 반복적으로 노출되면 개발자의 자체 어휘가 오염됩니다.
  5. 사용자 통제력 약화 – 시스템 프롬프트 스타일(CLAUDE.md, 출력 스타일 설정)이 몇 번의 교환 후에 변질되어 약속된 구성 가능성을 훼손합니다.

커뮤니티의 보완 방법(그리고 한계)

  • 공급자 전환 – OpenAI Codex나 이전 Opus 버전으로 이동하면 가독성이 회복되지만, 최신 추론 개선점은 잃게 됩니다.
  • 사용자 정의 출력 스타일 – 시스템 프롬프트에 "plain/concise" 스타일을 삽입하면 도움이 되지만, 몇 번의 교환 후 스타일이 자주 변질됩니다.
  • 후처리 – Opus 출력을 두 번째 모델(예: Haiku)을 통해 순수 영어로 재작성하는 것은 지연과 비용을 추가합니다.
  • 금지어 목록 – 사용자는 유해한 용어 목록을 유지 관리하지만, 모델은 때때로 이를 따르지만 자주 무시합니다.
  • 간단한 기술 영어 강제 – ASD‑STE100 기준을 적용하면 일부 사용자에게 명확성이 향상되지만, 지속적인 강화가 필요합니다.

사용자들이 원하는 것(Reddit 및 GitHub에서 요약)

  1. 간결하고 명시적인 서술 – Stack Overflow 답변이나 기술 보고서와 유사한 스타일.
  2. 결정 우선 형식 – 결정이나 결과를 먼저 제시하고, 선택적 근거를 뒤에 붙입니다.
  3. 창조된 전문 용어나 강제된 은유 없음 – 산업 표준 용어만 사용합니다.
  4. 스타일 강제의 안정성 – 세션 전체에 걸쳐 지속되는 시스템 프롬프트 또는 출력 스타일 설정.
  5. 추론 깊이 유지 – 변경은 어휘에만 영향을 주고, 모델의 문제 해결 능력에는 영향을 주지 않아야 합니다.

Anthropic의 반응(2026년 8월 기준)

  • 팀원 한 명이 피드백을 인정하고, 이 문제를 모델 행동 문제로 분류하며 모델 튜닝 부서로 이관될 것이라고 밝혔습니다.
  • 일시적인 완화 조치를 제안:
    • 사용자 정의 출력 스타일을 사용하여 각 턴마다 리마인더를 포함한 스타일 규칙을 삽입하세요(자세한 내용은 Claude Code 출력 스타일 문서 참조).
    • 스타일이 변질되는 구체적인 대화 예시를 제공하여 집중적인 하위 이슈를 만들 수 있습니다.
  • 명확한 일정이나 전용 "plain register" 제공에 대한 보장은 없었습니다.

잠재적인 원인(커뮤니티의 추측)

  • 워터마킹 편향 – 일부 사용자는 언어 워터마킹이 모델이 좁은 표현 집합으로 향하도록 유도하고, 의도치 않게 관찰된 전문 용어를 생성할 수 있다고 추측합니다.
  • 학습 목표 변화 – 토큰 효율성 또는 "창의적" 언어에 대한 강조가 증가하면서, 명확성보다는 독창성을 우선시하게 되었을 수 있습니다.
  • 에이전트 중심 설계 – Anthropic가 종단 간 자율 에이전트를 추진하면서, 모델이 인간이 읽기 쉬운 출력보다 내부 추론 기록에 최적화되었을 수 있습니다.

Anthropic에게 제안하는 사항

  1. 일등급 "plain" 레지스터 도입 – 전문 용어를 비활성화하고, 결정 우선 구조를 강제하며, 응답당 토큰 수를 제한하는 선택 가능한 출력 모드를 제공하세요.
  2. 스타일 지속성 결정론화 – 두 번 이상의 교환 후에도 시스템 프롬프트 스타일 규칙이 악화되지 않도록 보장하세요.
  3. 진단용 엔드포인트 제공 – 모델이 현재 "verbose" 또는 "plain" 모드에 있는지 여부를 나타내는 플래그를 반환하세요. 사용자가 디버깅에 도움을 받을 수 있습니다.
  4. 스타일 가이드라인 공개 – 구체적인 어휘 규칙(예: "load‑bearing" 금지, "important" 선호)을 문서화하여 커뮤니티가 프롬프트를 일치시킬 수 있도록 하세요.
  5. 정량적 지표 수집 – 모델 버전 간 응답당 토큰 수와 사용자 보고된 가독성 점수를 추적하여 조기 회귀를 탐지하세요.

결론

Claude Opus 4.8은 장황하고 전문 용어가 많은 출력으로의 회귀를 도입했으며, Opus 5.0은 이 문제를 거의 이해 불가능한 수준으로 악화시켰습니다. 이 문제는 Reddit, Hacker News, 공식 GitHub 트래커를 통해 널리 보고되었으며, 사용자들은 비용이 큰 보완 조치를 취하거나 플랫폼을 포기하고 있습니다. 생산성을 회복하고 사용자를 유지하기 위해 명확하고 안정적인 "plain" 출력 모드 및 더 강력한 스타일 지시사항 강제가 필수적입니다.

Sources

관련