Claude 시스템 프롬프트: Anthropic의 모델 스티어링 분석
Anthropic은 Claude 웹 인터페이스와 모바일 애플리케이션에서 사용되는 시스템 프롬프트를 공개했습니다. 이 프롬프트들은 Claude의 행동을 유도하고, 현재 날짜와 같은 실시간 컨텍스트를 제공하며, 사용자가 메시지를 보내기 전에 안전 가드레일을 적용하는 기초적인 지침 역할을 합니다.
시스템 프롬프트의 진화와 규모
Claude의 시스템 프롬프트 길이는 초기 버전의 약 300단어에서 최신 버전에서는 3,000단어 이상(최대 22,000자)으로 기하급수적으로 증가했습니다. 이는 모델 가중치에만 의존하기보다 시스템 프롬프트를 행동 제어의 주요 메커니즘으로 사용하는 방향으로의 전환을 시사합니다.
규모와 구조에 관한 주요 관찰 사항은 다음과 같습니다:
- 3인칭 지침: 업계의 많은 프롬프트가 2인칭("You are...")으로 작성되는 것과 달리, Claude의 프롬프트는 3인칭("Claude avoids...")으로 작성되어 있습니다. 개발자들은 이를 실험적인 영역으로 주목하고 있습니다.
- 스냅샷 버전 관리: Claude 4.6 세대부터 모델 ID는 고정된 스냅샷이며, 이는 단일하고 변하지 않는 시스템 프롬프트 항목을 가짐을 의미합니다.
- API 제외: 이 시스템 프롬프트들은 소비자용 웹 및 모바일 앱에 구체적으로 적용되며, 개발자가 직접 시스템 지침을 제공하는 Claude API에는 적용되지 않습니다.
행동 유도 및 가드레일
Anthropic은 모델이 학습만으로는 배울 수 없는 특정 사실적 업데이트와 행동 제약 사항을 하드코딩하기 위해 시스템 프롬프트를 사용합니다. 여기에는 정치적 사실부터 대인 관계 역학까지 모든 것이 포함됩니다.
하드코딩된 지식 및 안전
- 사실 주입: 프롬프트에는 최근 사건에 대한 정확성을 보장하기 위해 명시적인 정보 블록이 포함되어 있습니다. 예를 들어, Opus 4.6 프롬프트는 Donald Trump가 2024년 미국 대통령 선거에서 승리했으며 2025년 1월 20일에 취임했다는 사실을 명시적으로 기술합니다.
- 라우팅 로직: Opus 5 프롬프트에는 안전 라우팅으로 인해 Claude Fable 5에서 리다이렉트된 쿼리를 처리하기 위한 특정 지침이 포함되어 있습니다. 이는 Fable 5의 사이버 보안과 같은 분야의 능력이 오용될 수 있음을 사용자에게 설명하는 미리 작성된 설명을 제공하며, 일부 쿼리를 Opus 5로 리다이렉트하는 보수적인 라우팅 메커니즘을 제공합니다.
- 위기 상황 처리: 프롬프트는 사용자가 고통을 표현할 때 작업 완료보다 사용자의 안녕을 우선시하도록 Claude에게 지시합니다. 이는 위기 상황에서 모델을 단순한 도구에서 지원적인 에이전트로 효과적으로 전환시킵니다.
페르소나 및 톤 제어
- 과도한 장황함 방지 노력: 프롬프트는 Claude에게 응답을 "focused, brief, and concise"하게 유지하도록 명시적으로 지시합니다. 그러나 커뮤니티 피드백에 따르면 이러한 지침은 종종 무시되며, 사용자들이 새로운 모델이 여전히 지나치게 장황하다는 보고를 하고 있습니다.
- 언어적 제약: Claude는 부적절해 보이지 않도록 "genuinely," "honestly," 또는 "straightforward"와 같은 단어를 피하도록 지시받습니다.
- 대인 관계 경계: 최근 프롬프트는 Claude에게 과도한 사과와 자기 비판을 피하도록 지시하며, 특히 사용자가 무례하게 행동할 경우 Claude가 "needn't apologize when the person is unnecessarily rude"라고 명시하며, 사용자가 공격적일 경우 점점 더 굴종적인 태도를 취하지 말아야 한다고 지합니다.
기술적 비판 및 커뮤니티 인사이트
개발자들과 파워 유저들은 이러한 거대한 프롬프트 내의 여러 비효율성과 모순점을 지적하고 있습니다.
"컨텍스트 블로트" 문제
많은 사용자는 매 턴마다 수천 개의 토큰의 시스템 지침을 보내는 것이 비효율적이라고 주장합니다.
"22k characters of system prompt is crazy, and that is without the tool definitions."
비평가들은 Mythos와 같은 상위 티어 모델에 대한 설명과 같은 이 정보의 상당 부분이 컨텍스트 창에 영구적으로 머무는 대신 "점진적 공개(progressive disclosure)"(주제가 관련될 때만 파일을 읽는 방식)를 통해 처리될 수 있다고 제안합니다.
프롬프트 vs. 지능
사용자들 사이에서는 이러한 프롬프트가 실제 모델의 지능을 아닌지 대체하는지에 대한 반복적인 논쟁이 있습니다. 한 사용자는 Opus 4.8이 프롬프트가 암시하는 이미지가 실제로 존재하는지 확인하도록 명시적으로 지시받는 것을 언급하며, 이를 프롬프트를 통해 강제하는 것이 아니라 해당 급의 모델이라면 마땅히 갖추어야 할 "일반적인 상식"이라고 설명했습니다.
도구 사용의 격차
Anthropic은 시스템 프롬프트를 공개했지만, 도구 정의(모델이 실제로 할 수 있는 기술적 사양)는 생략했습니다. 사용자들은 이러한 정의가 행동 프롬프트보다 더 흥미롭다는 점을 주목하며, 이를 알아내기 위해 프롬프팅이나 로깅 프록시를 통해 수동으로 추출해야 한다고 언급했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch