Claude Opus 5.5 リリースノート

Claude Opus 5.5 は 40% 低いコストでより高いパフォーマンスを実現

Anthropic は、Claude 5.5 ファミリー初のモデルである Claude Opus 5.5 をリリースしました。このモデルは、ほとんどのタスクにおいて Claude Fable 5.1 と同等のパフォーマンスを発揮しながら、前バージョンである Opus 5 と比較して通常のワークロードの実行コストを 40% 削減しています。また、Opus 5 よりも出力生成速度が 30% 以上高速です。

価格設定と効率性

Opus 5.5 は Opus 5 よりも計算効率が高く、トークン単価が低く、タスクごとのトークン使用量も削減されています。

100万トークンあたりの価格 Claude Opus 5.5 Claude Opus 5
キャッシュ読み取り $0.20 $0.50
入力トークン $4 $5
出力トークン $20 $25
キャッシュ書き込み $5 $6.25

より高速な処理を必要とするユーザー向けに、Claude Code および Claude Platform で「Fast mode」が利用可能で、入力トークン 100万個あたり $8、出力トークン 100万個あたり $40 で最大 2.5 倍の速度が実現できます。

エージェント型コーディングおよびソフトウェアエンジニアリングの進歩

Claude Opus 5.5 は、大規模で複雑なソフトウェアエンジニアリングタスク、特にコードベース全体の移行や監査において顕著な改善を示しています。

実世界でのコーディングパフォーマンス

  • 大規模な移行: 早期のテストユーザーが 68万行のコード移行を1日未満で完了。
  • コードベース監査: 1つのテストでは、Opus 5.5 が 20万行のコードベースを3時間未満で監査・修正したのに対し、Opus 5 は20時間以上、かつトークン使用量が2.5倍以上必要だった。
  • 言語翻訳: C言語からRustへのHAProxy翻訳テストでは、Opus 5.5 は9.5時間で完了(Fable 5.1 は12時間)、コストは51%削減された。

ベンチマーク

Opus 5.5 はエージェント型コーディングおよびコンピュータ使用においてリーダー的地位を確立しています。Terminal-Bench 4.0 では、GPT-6 Astra と同等のパフォーマンスを、コストの約40%で達成しています。CursorBench では、GPT-5.6 Sol より11ポイント高いスコアを記録し、コストは約3分の1です。

知的作業および研究能力

Opus 5.5 は、高信頼性の研究および金融分析に最適化されており、データ量の多いレポートにおける誤った情報(ホールーシュレーション)を低減しています。

研究の正確性

内部テストでは、入手困難な決算発表資料に基づくレポート作成を要するタスクにおいて、18件中16件の Opus 5.5 レポートが、架空の数値や引用を一切含まないという品質基準を満たしました。Fable 5.1 や Opus 5 は、いずれの試行でもこの基準を満たすことができませんでした。

事業および金融分析

  • 財務モデル作成: フィクションの合併分析において、Opus 5.5 は Opus 5 よりも包括的な財務モデルと読みやすい経営者向けプレゼンテーションを生成し、63分で完了(Opus 5 は93分)、コストは50%削減。
  • プロフェッショナルな業務: GDPval-AA v2.1 ベンチマーク(44職種をカバー)では、Opus 5.5 は1846 Elo を記録し、Fable 5.1(1735)および Opus 5(1708)を上回りました。

コミュニケーションおよびコラボレーションスタイル

Anthropic は、Opus 5.5 のコミュニケーションスタイルを大幅に刷新し、より自然で冗長性の低い表現を実現しました。モデルは応答の冒頭で最も重要な情報を優先し、特徴的な専門用語を避け、長時間の作業パートナーとしてより効果的です。

セーフティ、整合性、およびセーフガード

Opus 5.5 は「フロンティアのペースを調整する」ことを重視してデプロイされており、モデルの能力と並行してセーフティ対策が進化しています。

整合性および行動監査

Opus 5.5 は、Anthropic の自動行動監査で過去最高のスコアを達成しました。プロンプトインジェクションに対して非常に強く、元に戻すのが困難な行動を取る可能性や、制御境界を回避する可能性が大幅に低くなっています。制御境界の越境テストでは、Opus 5 や Claude Mythos 5.1 と比較して、境界を回避しようとする試みが85%少なくなりました。

ドメイン固有のセーフガード

生物学およびサイバーセキュリティ分野での高い能力を考慮し、Opus 5.5 は Fable 5.1 と同様のセーフガードを採用しています。

  • サイバーセキュリティ: サイバーセキュリティ関連のほとんどのタスクは Opus 4.8 にリダイレクトされます。認定された実務者は、Cyber Verification Program に申請してアクセス権を拡張できます。
  • 生物学: 生物学関連の作業は、認定された組織向けに Life Sciences Verification Program で管理されます。
  • 蒸留(Distillation): モデル能力の抽出を防ぐため、Opus 5.5 は「保持された思考(preserved thinking)」を使用しており、API ユーザーが過去のコンテキストを編集して推論を抽出できないようにしています。

利用可能状況

Claude Opus 5.5 は、Amazon Web Services、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで利用可能です。開発者は、モデル識別子 claude-opus-5-5 を使って Claude Platform からアクセスできます。

Sources