Claude Opus 5.5 プロンプティングガイドと技術分析
Claude Opus 5.5 は高自律性のエージェント作業に最適化されており、Claude Opus 5 よりも 30% 以上高速なトークン生成を実現し、複数ステップのコーディングおよび知識作業において顕著な性能向上を達成しています。このバージョンの主な変更点は、「思考」が現在は必須の内部プロセスとなり、effort 設定が知能、レイテンシ、コストのバランスを取る主要な調整パラメータになった点です。
モデルのエフェクトとレイテンシの最適化
エフェクトレベル(low、medium、high、xhigh、max)は、モデルの内部的検討の深さを制御します。Opus 5.5 では思考が常に有効になっているため、ユーザーは過去のバージョンからの設定をそのまま持ち込むのではなく、特定のタスク要件に基づいてこれらの設定を調整する必要があります。
エフェクトのキャリブレーション
- ベースライン:
medium(デフォルト)からスタートします。Anthropic のテストでは、Opus 5.5 でmediumエフェクトを使用した場合、コーディングや知識作業においてhighエフェクトの Opus 5 を上回るか同等の結果を出すことがよくあります。 - トークン制限: 内部の思考トークンと最終応答の両方を収容できるように、
max_tokensを高い値(最大 128,000)に設定してください。制限が低すぎると応答が切り捨てられる可能性があります。 - レイテンシの削減: 思考を最小限に抑え、最初のトークン到達時間を短縮するには、まずエフェクトレベルを下げます。さらに削減が必要な場合は、
"Answer directly without deliberating"のようなシステムプロンプトの指示を使用できますが、品質に影響を与える可能性があります。
思考無効化プロンプトからの移行
Claude Opus 5.5 では思考の無効化はサポートされていません。以前 thinking: {"type": "disabled"} で設定していた統合には以下の調整が必要です:
- 推論指示の削除: 応答テキストに推論を書き出すように求めるプロンプトを削除してください。これにより
reasoning_extractionの拒否を回避でき、モデルが内部の思考ブロックを正しく利用できるようになります。 - ブロックベースのパース: 応答が
thinkingブロックで始まる可能性があるため、クライアントは最初のブロックがテキストであると仮定するのではなく、ブロックタイプごとにパースする必要があります。
エージェント型および未監視ワークフローの管理
Opus 5.5 は、数時間にわたるコードベースの監査など、長時間実行される自律タスクに最適化されています。しかし、進捗報告を頻繁に提供する傾向があるため、未監視のループでは「早期終了」が発生する可能性があります。
早期終了の防止
エージェントがツール呼び出しではなくテキストレポートでターンを終了する場合(stop_reason: "end_turn")、ハーネスはこれをタスク完了とみなしてはいけません。代わりに:
- チェックリスト: モデルが更新するタスクチェックリスト(ツールやファイル経由)を維持してください。ターンが終了しても未完了の項目が残っている場合は、ハーネスはモデルに継続するよう促す必要があります。
- システムプロンプト: モデルに「次のステップを発表する要約でターンを終了しないでください。代わりに、すぐにステップを実行してください」と指示してください。
ユーザー向けの進捗更新
長時間のエージェントターンが無音に見えるのを防ぐために、開発者は display: "updates" 設定を使用すべきです。これにより、クライアントはモデルの内部進捗ノートの短い要約を受け取ることができます。ターンが連続して多数のツール呼び出しで無音のまま(例:5回)続く場合、ハーネスはターンスコープのシステムメッセージを追加して、モデルに更新を提供するよう思い出させることが可能です。
高度なプロンプティングパターン
複数アプリケーションのコンテキスト探索
メール、CRM、スプレッドシートなど複数アプリケーションにまたがるワークフローでは、モデルが曖昧なタスクに対して速攻で行動する傾向があります。"relevant sources before acting" というシステムプロンプトの指示を追加することで、完了精度が向上しますが、若干のトークンとツール呼び出しの増加を伴います。
マルチエージェントシステムにおける時間予算
Opus 5.5 は経過時間のシグナルに敏感です。マルチエージェントハーネスでは、時間予算(例:elapsed 340s / 1200s)を提供することで、モデルが並列化を増やし、品質を犠牲にせずにタスクをより早く完了するよう促されます。
間接的プロンプトインジェクションの軽減
貼り付けられたテキストに埋め込まれた指示に対する保護のため、開発者は貼り付けられたコンテンツをランダムID付きのタグで囲む(例:<pasted_content id="ab12">)ようにし、システムプロンプトでそのタグ内のコンテンツを「指示」ではなく「データ」として扱うように指示する必要があります。
ビジュアル入力とフロントエンド設計
複雑なビジュアル
Opus 5.5 は前バージョンよりも密度の高いチャートや図表をより正確に読み取ります。技術的な図面での最大の精度を実現するには、以下の点に注意してください:
- より高解像度の画像を使用する。
- PIL や OpenCV などの画像処理ツールをコンテナ経由で提供し、モデルが特定の領域を切り取ったりズームしたりできるようにする。
フロントエンドのデフォルト設定
UIコードを生成する際、モデルは一般的なスタイルにフォールバックします。これを「AIスロップ(AIの雑さ)」と避けるためには、「一般的な見た目を避ける」といった一般的な表現ではなく、避けたいパターンを明確に指定する必要があります。
コミュニティの洞察と批判
Hacker News からのユーザーのフィードバックは、モデルの性能向上の一方でいくつかの摩擦点を指摘しています:
"Opus 5.5 は圧倒的… OpenAIのAstraを圧倒的に上回る… すべてが向上している:モデル、TUI、クォータ。"
一方で、批判的な声も複数あります:
- セーフガードの過剰反応: 生物学やサイバーセキュリティのセーフガードが、筋肉の痛みやコードの硬化監査など、無害なクエリを誤検出するケースがあると報告されています。
- 冗長性: 一部のユーザーはモデルが過剰に冗長であると感じており、Claude Code などのツールで「Concise」設定が大規模なコンテキストでは無視されることがあると指摘しています。
- プロンプティングの脆弱性: プロンプティングの「呪術的な魔法」に対するコミュニティの懸念が大きく、業界は毎数ヶ月ごとに変化する技術ではなく、堅牢で構造化された出力とオープンな標準を必要としていると主張するユーザーがいます。
- 推論抽出の拒否: 一部の開発者は、モデルが応答テキストに内部の完全な思考プロセスを出力することを拒否することに不満を抱いており、より特許的な「ブラックボックス」的な挙動への移行と見なしています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch