Anthropic Claude Sonnet 4.5 リリース:最先端のコーディングモデルと新しい開発者向けツール

TL;DR

Claude Sonnet 4.5 は Anthropic の最新フロンティアモデルであり、これまでで最強のコーディング、推論、およびコンピュータ使用能力を提供します。また、Claude Code のチェックポイント、VS Code 拡張機能、新しいコンテキスト編集ツール、およびオープンソースの Claude Agent SDK を含む一連の製品アップグレードとともに提供されます。


Claude Sonnet 4.5 とは

  • クラス最高のコーディングモデル – SWE-bench Verified ベンチマークでトップを記録し、複雑で多段階のタスクに 30 時間以上集中し続けることができます。
  • トップクラスのコンピュータ使用パフォーマンス – OSWorld で 61.4% を記録。わずか 4 か月前の Sonnet 4 の 42.2% から大幅に向上しました。
  • 推論と数学の向上 – 公開されている評価スイート全体で大幅な向上を示しています(発表内のベンチマーク表を参照)。
  • 最もアライメントされたフロンティアモデル – 安全性のトレーニングにより、おべっか(sycophancy)、欺瞞、権力志向、およびプロンプトインジェクションの脆弱性が軽減されています。
  • 価格は据え置き – 入力/出力 100 万トークンあたり $3 / $15 で、Claude Sonnet 4 と同一です。

コアとなる技術的進歩

コーディングと長期タスク

  • 30 時間以上の自律的なコーディングにおいて一貫性を維持し、エンジニアが数か月に及ぶアーキテクチャ作業を委ねることを可能にします。
  • 並列ツール実行によりコンテキストウィンドウあたりのアクションを最大化し、複数の bash コマンドを同時に実行できます。
  • 内部ベンチマークでは、Anthropic のコード編集テストセットにおけるエラー率が 9% から 0% に低下したことが報告されています。

コンピュータ使用 (OSWorld)

  • Web ナビゲーション、スプレッドシート操作、ファイル作成などの現実世界のコンピュータタスクにおいて 61.4% の成功率を達成。
  • Claude for Chrome 拡張機能で実証されており、モデルがブラウザ内で直接スプレッドシートを埋め、サイトを移動し、スライドを生成します。

推論 & 数学

  • 広範な推論および数学の評価スイートにおいて、従来の Claude モデルを凌駕しています(掲載されているベンチマーク表を参照)。
  • 金融、法律、医学、STEM の分野の専門家は、Opus 4.1 を含む旧モデルと比較して、知識と推論が劇的に向上したと報告しています。

アライメント & 安全性

  • 自動行動監査スコアにより、欺瞞的、おべっか、権力志向、および妄想的な出力の発生率が低下しています。
  • エージェント機能およびコンピュータ使用機能において、プロンプトインジェクションへの耐性が大幅に向上しました。
  • Anthropic の AI Safety Level 3 (ASL-3) フレームワークの下で展開されており、CBRN 分類器は初期リリースから誤検知を 10 分の 1 に減らすよう改良されています。

Sonnet 4.5 とともにリリースされた製品の強化

Claude Code

  • Checkpoints: ユーザーは進行状況を保存し、即座に以前の状態にロールバックできます。
  • シームレスな開発のための刷新されたターミナル UIネイティブ VS Code 拡張機能
  • コンテキスト編集 & メモリツール (Claude API 経由) により、エージェントがより長く実行し、より高い複雑度を処理できるようになります。

Claude Apps

  • 会話内で直接コード実行ファイル作成 (スプレッドシート、スライド、ドキュメント) を統合。
  • Claude for Chrome 拡張機能が、ウェイトリストに登録していた Max ユーザー向けに利用可能になりました。

Claude Agent SDK

  • Claude Code を支えるオープンソースのインフラストラクチャが、開発者がカスタムエージェントを構築するために利用可能になりました。
  • 長期実行のメモリ管理、権限システム、およびサブエージェントの調整を処理します。
  • コーディング以外のタスクにおいても同様の機能を提供することを約束し、ソフトウェア開発以外の分野へのモデルの有用性を拡張します。

初期顧客からのフィードバック (抜粋)

"Claude Sonnet 4.5 から最先端のコーディングパフォーマンスを実感しており、長期的なタスクにおける大幅な改善が見られます。これは、なぜ Cursor を使用している多くの開発者が、最も複雑な問題を解決するために Claude を選ぶのかを裏付けています。"

"Claude Sonnet 4.5 は GitHub Copilot の核心的な強みである、多段階の推論とコード理解を著しく向上させ、コードベース全体にわたる複雑なタスクを処理できるエージェント体験を可能にします。"

"Claude Sonnet 4.5 により、当社のセキュリティエージェントの平均脆弱性取り込み時間が 44% 短縮され、精度が 25% 向上したことで、ビジネスのリスク軽減に役立ちました。"

"モデルの編集能力は並外れています。Sonnet 4 で 9% だったエラー率が、当社の内部コード編集ベンチマークでは 0% になりました。"

"Claude Sonnet 4.5 は Devin システムのプランニング性能を 18%、エンドツーエンドの評価スコアを 12% 向上させました。これは Claude Sonnet 3.6 以降で最大の飛躍です。"

リサーチ・プレビュー: Imagine with Claude

  • Claude が事前に書かれたコードなしでソフトウェアをライブ生成し、リアルタイムの適応を示す一時的なデモ。
  • claude.ai/imagine にて、Max サブスクライバー向けに 5 日間利用可能。

Sonnet 4.5 へのアクセス方法

  • API: Claude API 経由でモデル識別子 claude-sonnet-4-5 を使用してください。
  • Apps: すべての有料 Claude アプリプランに、コード実行とファイル作成が含まれるようになりました。
  • Developer Platform: Claude Agent SDK と更新されたプラットフォームドキュメントが公開されています。

なぜこれが重要なのか

Claude Sonnet 4.5 は AI 支援ソフトウェア開発の最前線を押し広げ、これまで見たことのないレベルで推論、コーディング、コンピュータとの対話ができる自律型エージェントを可能にします。開発者向けのツール (チェックポイント、VS Code 拡張機能、Agent SDK) の同時リリースは、プロダクショングレードの AI エージェント構築の障壁を下げ、産業全体におけるソフトウェアの構築、監査、保守の方法を再構築する可能性があります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch