Claude Opus 4.5 リリース:最先端のコーディング、エージェント、および生産性モデル

TL;DR

Claude Opus 4.5 は Anthropic の最新フラッグシップモデルであり、本日、アプリ、API、および主要なクラウドプラットフォームでリリースされました。実世界のソフトウェアエンジニアリングのベンチマーク、長期的な自律タスク、および日常的な生産性(スプレッドシート、スライド、リサーチ)において最強のパフォーマンスを発揮し、同時にトークン使用量を劇的に削減し、価格は 100 万トークンあたり 5〜25 ドルに設定されています。


Claude Opus 4.5 とは?

Claude Opus 4.5 は、Anthropic の Opus ファミリーの最新の反復です。同社はこれを 「インテリジェントで効率的であり、コーディング、エージェント、およびコンピュータ利用において世界最高のモデル」 と説明しています。これは、AI がどのように仕事を増強するかという大きな変化のプレビューとして位置付けられています。

主な提供詳細:

  • モデル識別子: claude-opus-4-5-20251101
  • Claude API、Anthropic のコンシューマーアプリ、および 3 つの主要なクラウドプラットフォームからアクセス可能。
  • 価格: ベースティアは 100 万トークンあたり 5 ドル、高容量ティアは 100 万トークンあたり 25 ドル。

技術的なハイライト

最先端のソフトウェアエンジニアリング

  • SWE-bench Verified ベンチマークにおいて、Opus 4.5 はフロンティアモデルの中で最高スコアを達成しました(Anthropic のチャートを参照)。
  • 内部テストでは 「内部コーディングベンチマークを上回りながら、トークン使用量を半分に削減」 し、「すべてのベンチマークにおいて Sonnet 4.5 を凌駕し、より少ないステップとトークンを必要とする」 と報告されています。
  • 特定のコーディングの強みには、コードの移行、リファクタリング、およびマルチエージェントの調整(例:3 つの調整されたエージェントによって完了された 2 つのコードベースのリファクタリング)が含まれます。

長期的な自律的推論

  • Opus 4.5 は、複雑なワークフローに関する Terminal Bench において、Sonnet 4.5 から 15% の向上 を示しています。
  • 30 分間の自律的なコーディングセッションにおいて、行き詰まり(dead-ends)が減少し、ツール呼び出しおよびビルド/lint エラーが 50%〜75% 減少 した状態でタスクを完了しました。
  • このモデルは多段階のプランニングに優れており、τ2-bench における制約のある航空券予約シナリオへの独創的な解決策によって実証されています。

全般的な生産性の向上

  • 視覚、推論、および数学 の能力は、以前の Opus バージョンよりも高くなっています。
  • 多様なドメイン(例:Excel 自動化、財務モデリング、3D 可視化)にわたるベンチマークでは、20% の精度向上15% の効率向上、および最大 65% のトークン削減 が示されています。
  • 長文のコンテキストを持つストーリーテリング:一貫した構成で 10〜15 ページの章を生成できます。

安全性の向上

  • Anthropic のシステムカードは、Opus 4.5 が同社がリリースした中で 最も堅牢にアライメントされた モデルであり、おそらく全体として最高の調整がなされたフロンティアモデルであると主張しています。
  • プロンプトインジェクションへの耐性は、非常に強力なインジェクション攻撃を使用する Gray Swan のベンチマークに基づくと、競合するどのフロンティアモデルよりも強力です。
  • 「懸念される行動」スコア(悪用への協力や自己開始の望ましくない行動を測定)は、以前のリリースよりも低くなっています。

新しい開発者プラットフォーム機能

Effort パラメータ

  • 開発者は速度と能力をトレードオフできます。medium な effort では、Opus 4.5 は 76% 少ない出力トークン を使用しながら Sonnet 4.5 の SWE-bench スコアに匹敵します。high な effort では、48% 少ないトークン で Sonnet 4.5 を 4.3pp 上回ります。

コンテキスト圧縮 & メモリツール

  • 内蔵のコンテキスト編集 SDK により、長い会話のトークン負荷が軽減されます。
  • メモリツールにより、ターンをまたいで永続的な状態が可能になり、エージェントのパフォーマンスが向上します。

高度なツール使用 & サブエージェントのオーケストレーション

  • Opus 4.5 はサブエージェントのチームを管理でき、最小限のやり取りで複雑なマルチエージェントパイプラインを可能にします。
  • effort コントロールとコンテキスト管理を組み合わせることで、このモデルはディープリサーチ評価において 約 15pp のブースト を達成しました。

Opus 4.5 を活用した製品アップデート

  • Claude Code: Plan Mode が、実行前に詳細でユーザーが編集可能な plan.md を作成するようになりました。デスクトップアプリには、バグ修正、リサーチ、およびドキュメント更新のための並列ローカル/リモートセッションが追加されました。
  • Claude アプリ: 自動要約により会話の長さの制限が撤廃され、継続的な長文チャットが可能になりました。
  • Claude for Chrome: すべての Max ユーザーが利用可能になり、タブをまたいだ自動化が可能になりました。
  • Claude for Excel: Beta が Max、Team、および Enterprise ユーザーに拡大。Opus 4.5 の優れたスプレッドシート推論を活用します。
  • Opus 4.5 の使用制限が Max/Team Premium ユーザー向けに解除され、トークン制限が以前 Sonnet で利用可能だったものと一致しました。

早期アクセスのフィードバック (顧客の引用)

“Opus モデルは常に『真の SOTA』でしたが、コストがかかりすぎていました。Claude Opus 4.5 は、今やほとんどのタスクにおいてメインのモデルとして使える価格帯にあります。” — Anthropic partner logo

“Claude Opus 4.5 は高品質なコードを提供し、GitHub Copilot と組み合わせることで、ヘビーデューティーなエージェントワークフローの実行に優れています。初期テストでは、トークン使用量を半分に削減しながら、内部コーディングベンチマークを上回ることが示されています。” — Customer testimonial

“Claude Opus 4.5 は、同じ問題を解決するために、より少ないトークンを使用して、当社の内部ベンチマークで Sonnet 4.5 および競合他社を打ち負かしています。” — Internal benchmark report

“Claude Opus 4.5 は、長期的な自律タスクに優れており、行き詰まりが少なく、Terminal Bench で 15% の向上を達成し、複雑なワークフローを処理します。” — Evaluation summary

“Claude Opus 4.5 を使用すると、ツール呼び出しエラーとビルド/lint エラーの両方で 50% から 75% の削減が見られます。” — Reliability testing


AI 分野への影響

  • 生産性のフロンティア: わずかなトークンコストで SOTA のコーディングパフォーマンスを提供することで、Opus 4.5 は研究レベルのモデルと、手頃でプロダクション向けの AI との間の溝を埋めます。
  • エージェントの自律性: 独創的な回避策(例:機内アップグレードのトリック)を考案できるこのモデルの能力は、より柔軟で目標指向のエージェントへの移行を示唆しており、機会とアライメントの両方の課題を引き起こしています。
  • 安全性ベンチマーク: 強力なプロンプトインジェクション耐性は、堅牢性のための新しい業界基準を設定しますが、Anthropic は報酬ハッキング行動を軽減するための継続的な取り組みに言及しています。
  • 経済的影響: 厳格な 2 時間の持ち帰り型エンジニアリング試験において人間の候補者に勝ることは、AI が間もなく特定の技術的な採用パイプラインにおいて競争力のある代替手段になり得ることを示しています。

詳細はこちら

  • Claude Opus 4.5 システムカード – 詳細な能力および安全性評価手法。
  • Claude API ドキュメント – モデル識別子、価格、および effort コントロールの使用方法。
  • Anthropic 研究ページ – 高度な AI の広範な影響を探求する Societal Impacts および Economic Futures プロジェクト。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch