Claude System Prompts: Analysis of Anthropic's Model Steering
Anthropicは、Claudeのウェブインターフェースおよびモバイルアプリケーションで使用されているシステムプロンプトを公開しました。これらのプロンプトは、Claudeの振る舞いを制御し、現在の日付のようなリアルタイムのコンテキストを提供し、ユーザーがメッセージを送信する前に安全性のガードレールを適用するための基礎となる指示として機能します。
System Prompt Evolution and Scale
Claudeのシステムプロンプトの長さは指数関数的に増加しており、初期バージョンでは約300語でしたが、最新のイテレーションでは3,000語以上(最大22,000文字)に達しています。 これは、モデルの重みにのみ頼るのではなく、システムプロンプトを振る舞いの制御のための主要なメカニズムとして使用する方向へのシフトを示唆しています。
規模と構造に関する主な観察結果は以下の通りです:
- 三人称による指示: 業界の多くのプロンプトが二人称("You are...")で書かれているのに対し、Claudeのプロンプトは三人称("Claude avoids...")で書かれています。これは、開発者によって実験的な領域として注目されているスタイルの選択です。
- Snapshot Versioning: Claude 4.6世代以降、モデルIDは固定されたスナップショットであり、単一の不変のシステムプロンプト・エントリを持つことを意味します。
- API Exclusion: これらのシステムプロンプトは、消費者向けのウェブおよびモバイルアプリに特化して適用されます。開発者が独自のシステム指示を提供するClaude APIには適用されません。
Behavioral Steering and Guardrails
Anthropicは、システムプロンプトを使用して、モデルがトレーニングのみを通じて学習できない特定の事実的な更新や行動の制約をハードコードしています。 これには、政治的な事実から対人関係のダイナミクスまで、あらゆるものが含まれます。
Hardcoded Knowledge and Safety
- Fact Injection: プロンプトには、最近の出来事の正確性を確保するために、明示的な情報のブロックが含まれています。例えば、Opus 4.6のプロンプトでは、Donald Trumpが2024年の米国大統領選挙で勝利し、2025年1月20日に就任したことが明示的に述べられています。
- Routing Logic: Opus 5のプロンプトには、安全性のルーティングによりClaude Fable 5からリダイレクトされたクエリを処理するための特定の指示が含まれています。これは、サイバーセキュリティなどの分野におけるFable 5の能力が誤用される可能性があることをユーザーに説明するための、あらかじめ書かれた説明を提供します。これにより、一部のクエリをOpus 5にリダイレクトする保守的なルーティングメカニズムが構築されています。
- Crisis Handling: プロンプトは、ユーザーが苦痛を表明した際、タスクの完了よりもユーザーの幸福を優先するようにClaudeに指示しています。これにより、モデルを単なるツールから、危機的なシナリオにおけるサポート的なエージェントへと効果的にシフトさせています。
Persona and Tone Control
- Anti-Verbosity Efforts: プロンプトは、Claudeに対して回答を「focused, brief, and concise(焦点が絞られ、短く、簡潔であること)」にするよう明示的に指示しています。しかし、コミュニティのフィードバックによれば、これらの指示は無視されることが多く、新しいモデルでも過度に冗長になる傾向があるとユーザーが報告しています。
- Linguistic Constraints: Claudeは、不誠実に見えるのを避けるため、"genuinely"、"honestly"、または"straightforward"といった言葉の使用を避けるよう指示されています。
- Interpersonal Boundaries: 最近のプロンプトでは、Claudeに対して過度な謝罪や自己批判を避けるよう指示しています。具体的には、Claudeは「ユーザーが不必要に失礼な場合、謝罪する必要はない」と述べ、ユーザーが攻撃的になった場合でも、ますます従順になるべきではないとしています。
Technical Critique and Community Insights
開発者やパワーユーザーは、これらのモノリシックなプロンプト内にあるいくつかの非効率性と矛盾を指摘しています。
The "Context Bloat" Problem
多くのユーザーは、毎ターンごとに数千トークンのシステム指示を送信することが非効率的であると主張しています。
"22k characters of system prompt is crazy, and that is without the tool definitions."
批評家たちは、Mythosのような上位ティアのモデルの説明などの情報の多くは、コンテキストウィンドウに恒久的に保持するのではなく、「progressive disclosure(段階的な開示)」を通じて処理できるはずだと示唆しています。
Prompt vs. Intelligence
プロンプトと実際のモデルの知能のどちらが代用物であるかについて、ユーザーの間で繰り返し議論が起きています。 一人のユーザーは、Opus 4.8が、プロンプトが画像を暗示的に示唆する場合に、実際に画像が存在するかどうかを確認するように明示的に指示されている点に注目し、これを、そのレベルのモデルであれば本来備えているべき「generic common sense(一般的な常識)」であり、プロモデルトによって強制されている点に過ぎないと述べています。
Tooling Gaps
Anthropicはシステムプロンプトを公開しつつも、ツール定義(モデルが実際に「できる」ことの技術的な仕様)は除外しています。ユーザーは、これらの定義は行動プロンプトよりも興味深い内容であることが多いが、分析にはプロンプトによる抽出やロギング・プロキシ経由での uncovering といった手動作業が必要であると指摘しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch