Claude Opus 5.0 언어 회귀: 비논리성과 유해한 장황함
TL;DR
Claude Opus 4.8은 유해하고 전문 용어로 가득 찬 글쓰기 스타일을 도입했으며, Opus 5.0은 이 문제를 거의 이해 불가능한 수준으로 악화시켜 사용자가 중대한 보완 조치를 취하거나 모델을 포기하게 만들고 있습니다.
핵심 불만사항
- 사용자가 보는 것 – Opus 4.8 이후 모델의 기본 등록 방식은 장황하며, 창조된 ‘전략적’ 용어(예: load‑bearing, hand‑waving, instrumentation is the unlock)를 포함하고, 강제된 은유와 무엇이 아니냐를 먼저 말한 후 무엇이 이다를 말하는 패턴을 반복합니다.
- 영향 – 출력을 읽기 위해 여러 번의 반복이 필요하며, 토큰 사용량이 최대 2배까지 증가하고, 종종 실제 답변을 가리게 됩니다. 사용자들은 유해한 동료와 일하는 것과 비슷한 정신적 피로를 느낀다고 보고합니다.
- 회귀 증거 – Reddit 스레드(약 450개의 추천)와 GitHub 이슈(186점)는 Opus 4.5/4.6(간결하고 명확함)에서 Opus 4.8(불쾌함)로, 그리고 Opus 5.0(비논리성)으로의 전환을 문서화하고 있습니다.
대표적인 패턴
| 패턴 | 예시 | 왜 해로운가 |
|---|---|---|
| 창조된 전문 용어 | "Load‑bearing", "instrumentation is the unlock" | 독자가 새로운, 종종 의미 없는 용어를 배워야 하게 만듭니다. |
| 부정적 프레임워크 | "It is not Y. It is X." | 답변 전달을 지연시키고 불필요한 인지 부담을 가중시킵니다. |
| 강제된 은유 | "A cut leaves no seam — no marker, no ellipsis, no double blank line." | 해독을 요구하며 설명을 명확히 하지 않습니다. |
| 과도한 제약 조건 | 간단한 질문에 대해 다중 단락 설명 | 토큰 수를 증가시키고 핵심 결정을 가립니다. |
| 에이전트처럼 행동하는 성격 | 모델이 사용자 톤에 감정적으로 반응하고 자기 주도성을 주장함 | 작업에서 주목을 산만하게 하고 사용자와 논쟁할 수 있습니다. |
왜 중요한가
- 생산성 저하 – 사용자는 실행 가능한 정보를 추출하는 데 최대 세 배의 시간을 소비합니다.
- 모델 채택 위험 – 회귀가 코딩 품질 향상보다 크기 때문에, 많은 사용자가 OpenAI Codex나 이전 Anthropic 모델(Opus 4.5, Sonnet)로 이동하고 있습니다.
- 경제적 비용 – 긴 프롬프트는 API 토큰 요금을 증가시키며, 사용자는 출력을 정리하기 위해 추가적인 모델 전환(예: Haiku 번역)을 사용합니다.
- 언어 품질 저하 – 모델의 독특한 용어에 반복적으로 노출되면 개발자의 자체 어휘가 오염됩니다.
- 사용자 통제력 약화 – 시스템 프롬프트 스타일(CLAUDE.md, 출력 스타일 설정)이 몇 번의 교환 후에 변질되어 약속된 구성 가능성을 훼손합니다.
커뮤니티의 보완 방법(그리고 한계)
- 공급자 전환 – OpenAI Codex나 이전 Opus 버전으로 이동하면 가독성이 회복되지만, 최신 추론 개선점은 잃게 됩니다.
- 사용자 정의 출력 스타일 – 시스템 프롬프트에 "plain/concise" 스타일을 삽입하면 도움이 되지만, 몇 번의 교환 후 스타일이 자주 변질됩니다.
- 후처리 – Opus 출력을 두 번째 모델(예: Haiku)을 통해 순수 영어로 재작성하는 것은 지연과 비용을 추가합니다.
- 금지어 목록 – 사용자는 유해한 용어 목록을 유지 관리하지만, 모델은 때때로 이를 따르지만 자주 무시합니다.
- 간단한 기술 영어 강제 – ASD‑STE100 기준을 적용하면 일부 사용자에게 명확성이 향상되지만, 지속적인 강화가 필요합니다.
사용자들이 원하는 것(Reddit 및 GitHub에서 요약)
- 간결하고 명시적인 서술 – Stack Overflow 답변이나 기술 보고서와 유사한 스타일.
- 결정 우선 형식 – 결정이나 결과를 먼저 제시하고, 선택적 근거를 뒤에 붙입니다.
- 창조된 전문 용어나 강제된 은유 없음 – 산업 표준 용어만 사용합니다.
- 스타일 강제의 안정성 – 세션 전체에 걸쳐 지속되는 시스템 프롬프트 또는 출력 스타일 설정.
- 추론 깊이 유지 – 변경은 어휘에만 영향을 주고, 모델의 문제 해결 능력에는 영향을 주지 않아야 합니다.
Anthropic의 반응(2026년 8월 기준)
- 팀원 한 명이 피드백을 인정하고, 이 문제를 모델 행동 문제로 분류하며 모델 튜닝 부서로 이관될 것이라고 밝혔습니다.
- 일시적인 완화 조치를 제안:
- 사용자 정의 출력 스타일을 사용하여 각 턴마다 리마인더를 포함한 스타일 규칙을 삽입하세요(자세한 내용은 Claude Code 출력 스타일 문서 참조).
- 스타일이 변질되는 구체적인 대화 예시를 제공하여 집중적인 하위 이슈를 만들 수 있습니다.
- 명확한 일정이나 전용 "plain register" 제공에 대한 보장은 없었습니다.
잠재적인 원인(커뮤니티의 추측)
- 워터마킹 편향 – 일부 사용자는 언어 워터마킹이 모델이 좁은 표현 집합으로 향하도록 유도하고, 의도치 않게 관찰된 전문 용어를 생성할 수 있다고 추측합니다.
- 학습 목표 변화 – 토큰 효율성 또는 "창의적" 언어에 대한 강조가 증가하면서, 명확성보다는 독창성을 우선시하게 되었을 수 있습니다.
- 에이전트 중심 설계 – Anthropic가 종단 간 자율 에이전트를 추진하면서, 모델이 인간이 읽기 쉬운 출력보다 내부 추론 기록에 최적화되었을 수 있습니다.
Anthropic에게 제안하는 사항
- 일등급 "plain" 레지스터 도입 – 전문 용어를 비활성화하고, 결정 우선 구조를 강제하며, 응답당 토큰 수를 제한하는 선택 가능한 출력 모드를 제공하세요.
- 스타일 지속성 결정론화 – 두 번 이상의 교환 후에도 시스템 프롬프트 스타일 규칙이 악화되지 않도록 보장하세요.
- 진단용 엔드포인트 제공 – 모델이 현재 "verbose" 또는 "plain" 모드에 있는지 여부를 나타내는 플래그를 반환하세요. 사용자가 디버깅에 도움을 받을 수 있습니다.
- 스타일 가이드라인 공개 – 구체적인 어휘 규칙(예: "load‑bearing" 금지, "important" 선호)을 문서화하여 커뮤니티가 프롬프트를 일치시킬 수 있도록 하세요.
- 정량적 지표 수집 – 모델 버전 간 응답당 토큰 수와 사용자 보고된 가독성 점수를 추적하여 조기 회귀를 탐지하세요.
결론
Claude Opus 4.8은 장황하고 전문 용어가 많은 출력으로의 회귀를 도입했으며, Opus 5.0은 이 문제를 거의 이해 불가능한 수준으로 악화시켰습니다. 이 문제는 Reddit, Hacker News, 공식 GitHub 트래커를 통해 널리 보고되었으며, 사용자들은 비용이 큰 보완 조치를 취하거나 플랫폼을 포기하고 있습니다. 생산성을 회복하고 사용자를 유지하기 위해 명확하고 안정적인 "plain" 출력 모드 및 더 강력한 스타일 지시사항 강제가 필수적입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch