Claude Code 노력 수준 A/B 테스트 및 사용자 피드백
Claude Code 내 Anthropic의 노력 수준 매핑 A/B 테스트
Anthropic은 Claude Code(버전 2.1.236 이상)에서 수치적 노력 값이 "effort" 설정에 어떻게 매핑되는지에 대해 서버 측 A/B 테스트를 진행하고 있습니다. 이 테스트에서는 "high" 노력 설정과 관련된 수치적 값이 이전 버전보다 더 낮은 숫자(예: 100 중 10)로 매핑될 수 있으며, 이로 인해 일부 사용자들이 모델 성능이나 "지능"이 저하된 것으로 인식할 수 있습니다.
기술적 구현 및 공식 답변
Claude Code 팀의 Thariq는 이러한 변경 사항이 서버 측 API 서빙 구성임을 명확히 했습니다. 표시되거나 로그에 기록되는 수치적 값(예: high effort 설정에 대해 "10"이 나타나는 경우)은 내부 매핑이며, 실제 노력의 0-100 척도를 반드시 나타내는 것은 아닙니다.
Claude Code 팀에 따르면, 사용자가 선택한 노력 수준은 실제 모델 성능 측면에서 동일하게 유지됩니다. 팀은 심층적인 평가를 통해 이러한 매핑 변경이 모델 성능에 영향을 미치지 않음을 확인했다고 주장합니다. 명확한 성능 저하를 경험하는 사용자는 /feedback 명령어를 사용하여 세션 ID와 함께 문제를 보고할 것을 권장합니다.
모델 성능에 대한 사용자 인식
공식적인 보장에도 불구하고, 여러 사용자가 새로운 모델 버전, 특히 "Fable" 및 "Opus 5"를 언급하며 출력 품질의 눈에 띄는 저하를 보고하고 있습니다.
- 작업 실행의 비효율성: 한 사용자는 이전 버전 4.6에서 2분 미만이 소요되었던 간단한 설정 파일 업데이트가 Opus 5에서는 43분이 소요되었으며, 요청 범위를 초과하는 불필요한 샌드박스와 테스트 스위트가 포함되었다고 보고했습니다.
- 탈선 및 과잉 엔지니어링: 일부 사용자는 Opus 5와 Sonnet 5가 이전 모델과 비교하여, 특히 "high" 노력 설정 시 요청하지 않은 주제로 탈선하는 경향이이 있다고 관찰했습니다.
- 모델 성능 저하: 일부 사용자는 Fable 모델의 품질 저하를 인지하여 구독을 하위 등급으로 낮추거나 대체 모델(예: Codex 또는 GLM-5.3)로 전환했습니다.
AI 인센티브 및 과금 체계에 대한 커뮤니티 논의
이번 사건은 LLM 제공업체의 투명성에 관한 더 넓은 커뮤니티 논의를 촉발했습니다. 사용자들은 수익을 극대화하기 위해 제품이 사용자에게 덜 유용해지는 과정인 "enshitification"—이 프로세스 및 토큰 기반 과금의 불투명한 특성에 대해 우려를 표명했습니다.
"왜 우리는 정렬된 인센티브가 없는 운영자들에 의해 완전히 통제되고 모호한 토큰 단위로 과금이 이루어지는 것을 허용하고 있는가?"
비평가들은 원시 컴퓨팅 자원이나 리소스 사용량이 아닌 토큰 기반의 과금 모델이 제공업체로 하여금 사용자의 가시성 없이 백엔드에서 모델 동작이나 라우팅을 변경할 수 있게 하여, 잠재적으로 더 낮은 품질의 응답답을 위해 더 높은 비용을 지불하게 만들 수 있다고 주장합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch