Anthropic Claude 코드 품질 사후 분석 보고서
Anthropic는 Claude Code, Claude Agent SDK, Claude Cowork에서 인지된 품질 저하를 유발한 세 가지 별개의 기술적 문제를 식별하고 해결했습니다. 모든 문제는 4월 20일(버전 2.1.116) 기준으로 해결되었으며, 4월 23일 기준으로 모든 구독자에 대한 사용 한도를 재설정했습니다.
품질 저하의 근본 원인
Anthropic는 2026년 3월부터 4월 20일 사이에 시행된 세 가지 개별 변경 사항이 성능 저하를 유발했다고 추적했습니다. API 및 추론 계층은 이러한 사건 동안 영향을 받지 않았습니다.
1. 기본 추론 노력 감소
3월 4일, Anthropic는 Claude Code의 기본 추론 노력 값을 high에서 medium으로 변경했습니다. 이는 UI가 멈춘 것처럼 보이는 장기 꼬리 지연(latency)을 줄이고 사용자 사용 한도를 최대화하기 위한 목적입니다.
내부 평가에서는 대부분의 작업에서 중간 수준의 노력이 충분한 지능을 제공하면서 지연 시간을 크게 줄일 수 있다고 판단했지만, 사용자 피드백은 지능의 명확한 하락을 보고했습니다. Anthropic는 이 변경 사항을 4월 7일에 되돌렸습니다. 현재 기본 설정은 Opus 4.7에 대해 xhigh로, 모든 다른 모델에 대해 high로 설정되어 있습니다.
2. 세션 메모리 및 캐시 버그
3월 26일, 1시간 이상 대기 중인 세션을 재개할 때 비용을 줄이기 위해 캐시 최적화가 도입되었습니다. 이는 clear_thinking_20251015 API 헤더와 keep:1을 사용해 오래된 사고 섹션을 삭제하는 방식이었습니다.
구현 중 발생한 버그로 인해 시스템은 세션의 나머지 시간 동안 각 턴마다 사고 기록을 지우게 되었으며, 이는 다음과 같은 문제를 야기했습니다:
- 기억 상실 및 반복: Claude는 이전 편집이나 도구 호출을 왜 했는지 기억을 잃게 되었습니다.
- 비용 증가: 지속적인 사고 블록 삭제로 인해 캐시 미스가 자주 발생하여 사용자 사용 한도가 예상보다 빠르게 소진되었습니다.
이 문제는 4월 10일(버전 2.1.101)에 해결되었습니다. Anthropic는 Opus 4.7이 전체 저장소 컨텍스트를 제공받았을 때 백테스트 중 이 버그를 식별할 수 있었지만, Opus 4.6은 이를 식별하지 못했다고 언급했습니다.
3. 시스템 프롬프트의 과도한 문장 길이 제약
4월 16일, Opus 4.7이 과도한 출력 토큰을 생성하는 경향이 있어, 시스템 프롬프트에 도구 호출 사이의 텍스트 길이를 $\$25$ 단어 이하로 유지하고 최종 응답은 $\$100$ 단어 이하로 제한하는 지침이 추가되었습니다. 단, 더 많은 세부 정보가 필요할 경우 예외가 적용됩니다.
이후의 분석(ablations) 결과, 이 제약이 Opus 4.6과 Opus 4.7 모두에서 성능을 3% 하락시켰습니다. 프롬프트는 4월 20일에 되돌려졌습니다.
향후 예방 조치
유사한 성능 저하를 방지하기 위해 Anthropic는 개발 및 배포 파이프라인에 다음과 같은 변경 사항을 도입하고 있습니다:
- 내부 테스트: 내부 직원의 더 큰 비중이 이제 공개 빌드의 정확한 버전을 사용하여 테스트 환경이 사용자 경험과 일치함을 보장할 것입니다.
- 코드 리뷰 도구 개선: 내부 코드 리뷰 도구에 대한 개선이 진행 중이며, 개선된 버전을 고객에게 제공할 계획입니다.
- 프롬프트 거버넌스: 시스템 프롬프트 변경에 대해 더 강력한 통제를 도입할 예정이며, 모델별 폭넓은 평가, 개별 라인의 영향을 이해하기 위한 지속적인 분석, 새로운 감사 도구를 포함합니다.
- 배포 전략: 지능에 대한 희생을 수반하는 변경 사항은 이제 소aks 기간, 더 광범위한 평가 세트, 점진적인 롤아웃을 요구합니다.
- 모델별 게이팅:
CLAUDE.md에 모델별 변경 사항이 타겟 모델에만 적용되도록 안내가 추가되었습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch