Anthropic Claude Sonnet 4.6 リリース:機能強化と100万トークンのコンテキスト

TL;DR

Claude Sonnet 4.6 は、Anthropic の Free、Pro、および Claude Cowork プランのデフォルトモデルとなり、コーディング、コンピュータ使用、長文コンテキスト推論、エージェント計画において著しく向上した性能を提供します。また、ベータ版として 100 万トークンのコンテキストウィンドウを提供し、価格は Sonnet 4.5 と同じ 100 万トークンあたり 3ドル/15ドルを維持しています。


コアとなる技術的アップグレード

全般的なスキルの向上 – Sonnet 4.6 は、コーディング、コンピュータ使用、長文コンテキスト推論、エージェント計画、ナレッジワーク、およびデザインを改善しています。モデルの指示に従う一貫性とハルシネーションの減少は、前身のモデルや、旧世代の Opus 4.5 フロンティアモデルをも凌駕すると報告されています。

100万トークンのコンテキストウィンドウ(ベータ版) – 拡張されたウィンドウにより、単一のリクエストでコードベース全体、長い契約書、または数十本の研究論文を保持でき、Vending-Bench Arena の評価で示されているように、その長さに対して効果的な推論能力を発揮します。

安全性の大幅な強化 – 広範な安全性評価により、Sonnet 4.6 は最新の Claude モデルと同等、あるいはそれ以上に安全であることが示されています。「温かみがあり、誠実で、社会に貢献する」キャラクターを持ち、重大な高リスクの不整合に関する懸念はありません。プロンプト・インジェクションへの耐性も Sonnet 4.5 と比較して著しく向上しています。


コンピュータ使用機能

実験段階からプロダクショングレードへ – 2024年10月に Anthropic が初の汎用コンピュータ使用モデルを発表して以来、Sonnet モデルは OSWorld ベンチマークを着実に上昇してきました。Sonnet 4.6 は、複雑なスプレッドシートの操作や多段階の Web フォーム入力などのタスクにおいて、人間レベルのパフォーマンスを達成しています。

ベンチマークによる証拠 – OSWorld-Verified スコア(2025年7月発表)では、Sonnet 4.6 が数百の実際のソフトウェアタスク(Chrome、LibreOffice、VS Code など)において、以前の Sonnet バージョンを上回っていることが示されています。

リスク軽減 – プロンプト・インジェクション攻撃は依然として懸念事項ですが、安全性テストでは Sonnet 4.6 の耐性は Opus 4.6 に匹敵することが示されています。Anthropic は API ドキュメントで軽減策のガイダンスを提供しています。


ベンチマークおよびユーザー向けパフォーマンス

評価項目 相対的なパフォーマンス 特筆すべき観察事項
Claude Code (コーディング) Sonnet 4.5 より約70%好ましい、Opus 4.5 より59%好ましい コンテキストの読み取りが向上、ロジックの重複が減少、ハルシネーションが減少
OfficeQA (エンタープライズ文書推論) Opus 4.6 に匹敵 文書理解ワークロードにおける大幅なアップグレード
Vending-Bench Arena (長期ビジネスシミュレーション) 初期に多額の投資を行い、後に収益性に転換することで Sonnet 4.5 を凌駕 数ヶ月にわたる期間の戦略的計画能力を実証
OSWorld-Verified (コンピュータ使用) Sonnet モデルの中で最高スコア。パートナーの保険ベンチマークにおいて評価モデル中最高(精度94%)

顧客からのフィードバック – 複数のパートナー(Databricks, Replit, Cursor, GitHub, Cognition, Windsurf, Hebbia, Box, Pace, Bolt, Rakuten, Zapier, Convey, Triple Whale, Harvey)から、Sonnet 4.6 は以下の点で高く評価されています:

  • より洗練された視覚的出力とデザインセンス
  • 大規模なコードベースにおける複雑なコード修正の迅速な解決
  • バグ検出とレビューのスループットの向上
  • 金融サービスベンチマークにおける回答一致率の向上
  • 契約ルーティングや CRM 調整における強力な多段階推論

製品および API の強化

  • 適応的かつ拡張された思考 が Claude プラットフォームでサポートされ、ベータ版のコンテキスト圧縮により、古い会話のターンを自動的に要約します。
  • Web 検索および取得ツール がフィルタリングコードを生成・実行するようになり、関連するコンテンツのみをコンテキストに保持することで、トークン効率を向上させます。
  • ツールスイート – コード実行、メモリ、プログラムによるツール呼び出し、ツール検索、およびツール使用の例が一般に利用可能になります。
  • Claude in Excel – MCP コネクタにより、スプレッドシートを離れることなく、S&P Global、LSEG、PitchBook、Moody’s、FactSet などからシームレスにデータを取得できます。

利用可能性と移行

Claude Sonnet 4.6 は、すべての Claude プラン、Claude Cowork、Claude Code、API、および主要なクラウドプラットフォームで利用可能です。無料ティアでは Sonnet 4.6 がデフォルトとなり、ファイルの作成、コネクタ、スキル、およびコンテキスト圧縮が含まれます。開発者は Claude API の claude-sonnet-4-6 という識別子を使用してモデルの使用を開始できます。


ユーザーと市場への影響

  • 費用対効果の高いフロンティア・パフォーマンス – Sonnet 4.6 は、より低価格な Sonnet の価格設定で Opus に近い推論品質を提供し、重量級の AI ワークロードにおける実現可能なユースケースを拡大します。
  • 自動化の拡大 – 成熟したコンピュータ使用能力により、カスタムコネクタの必要性が減少し、AI が UI を通じてレガシーソフトウェアと対話できるようになります。
  • 長文コンテキスト推論 – 100万トークンのウィンドウにより、以前は不可能であった全文文書分析、広範なコードベースへのクエリ、および多段階の計画が可能になります。
  • 安全性への姿勢 – 安全性テストとプロンプト・インジェクション軽減への継続的な重点化は、責任ある AI プロバイダーとしての Anthropic のポジショニングを強化します。

関連発表

  • Fable 5 のバイオロジー・セーフガードの改善 – 詳細は Anthropic のブログをご覧ください。
  • Mariano-Florentino (Tino) Cuéllar が最高グローバル・アフェアーズ・オフィサーとして Anthropic に加入 – 企業リーダーシップの更新情報。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch