Anthropic Claude Sonnet 4.6 リリース:機能強化と100万トークンのコンテキスト
TL;DR
Claude Sonnet 4.6 は、Anthropic の Free、Pro、および Claude Cowork プランのデフォルトモデルとなり、コーディング、コンピュータ使用、長文コンテキスト推論、エージェント計画において著しく向上した性能を提供します。また、ベータ版として 100 万トークンのコンテキストウィンドウを提供し、価格は Sonnet 4.5 と同じ 100 万トークンあたり 3ドル/15ドルを維持しています。
コアとなる技術的アップグレード
全般的なスキルの向上 – Sonnet 4.6 は、コーディング、コンピュータ使用、長文コンテキスト推論、エージェント計画、ナレッジワーク、およびデザインを改善しています。モデルの指示に従う一貫性とハルシネーションの減少は、前身のモデルや、旧世代の Opus 4.5 フロンティアモデルをも凌駕すると報告されています。
100万トークンのコンテキストウィンドウ(ベータ版) – 拡張されたウィンドウにより、単一のリクエストでコードベース全体、長い契約書、または数十本の研究論文を保持でき、Vending-Bench Arena の評価で示されているように、その長さに対して効果的な推論能力を発揮します。
安全性の大幅な強化 – 広範な安全性評価により、Sonnet 4.6 は最新の Claude モデルと同等、あるいはそれ以上に安全であることが示されています。「温かみがあり、誠実で、社会に貢献する」キャラクターを持ち、重大な高リスクの不整合に関する懸念はありません。プロンプト・インジェクションへの耐性も Sonnet 4.5 と比較して著しく向上しています。
コンピュータ使用機能
実験段階からプロダクショングレードへ – 2024年10月に Anthropic が初の汎用コンピュータ使用モデルを発表して以来、Sonnet モデルは OSWorld ベンチマークを着実に上昇してきました。Sonnet 4.6 は、複雑なスプレッドシートの操作や多段階の Web フォーム入力などのタスクにおいて、人間レベルのパフォーマンスを達成しています。
ベンチマークによる証拠 – OSWorld-Verified スコア(2025年7月発表)では、Sonnet 4.6 が数百の実際のソフトウェアタスク(Chrome、LibreOffice、VS Code など)において、以前の Sonnet バージョンを上回っていることが示されています。
リスク軽減 – プロンプト・インジェクション攻撃は依然として懸念事項ですが、安全性テストでは Sonnet 4.6 の耐性は Opus 4.6 に匹敵することが示されています。Anthropic は API ドキュメントで軽減策のガイダンスを提供しています。
ベンチマークおよびユーザー向けパフォーマンス
| 評価項目 | 相対的なパフォーマンス | 特筆すべき観察事項 |
|---|---|---|
| Claude Code (コーディング) | Sonnet 4.5 より約70%好ましい、Opus 4.5 より59%好ましい | コンテキストの読み取りが向上、ロジックの重複が減少、ハルシネーションが減少 |
| OfficeQA (エンタープライズ文書推論) | Opus 4.6 に匹敵 | 文書理解ワークロードにおける大幅なアップグレード |
| Vending-Bench Arena (長期ビジネスシミュレーション) | 初期に多額の投資を行い、後に収益性に転換することで Sonnet 4.5 を凌駕 | 数ヶ月にわたる期間の戦略的計画能力を実証 |
| OSWorld-Verified (コンピュータ使用) | Sonnet モデルの中で最高スコア。パートナーの保険ベンチマークにおいて評価モデル中最高(精度94%) |
顧客からのフィードバック – 複数のパートナー(Databricks, Replit, Cursor, GitHub, Cognition, Windsurf, Hebbia, Box, Pace, Bolt, Rakuten, Zapier, Convey, Triple Whale, Harvey)から、Sonnet 4.6 は以下の点で高く評価されています:
- より洗練された視覚的出力とデザインセンス
- 大規模なコードベースにおける複雑なコード修正の迅速な解決
- バグ検出とレビューのスループットの向上
- 金融サービスベンチマークにおける回答一致率の向上
- 契約ルーティングや CRM 調整における強力な多段階推論
製品および API の強化
- 適応的かつ拡張された思考 が Claude プラットフォームでサポートされ、ベータ版のコンテキスト圧縮により、古い会話のターンを自動的に要約します。
- Web 検索および取得ツール がフィルタリングコードを生成・実行するようになり、関連するコンテンツのみをコンテキストに保持することで、トークン効率を向上させます。
- ツールスイート – コード実行、メモリ、プログラムによるツール呼び出し、ツール検索、およびツール使用の例が一般に利用可能になります。
- Claude in Excel – MCP コネクタにより、スプレッドシートを離れることなく、S&P Global、LSEG、PitchBook、Moody’s、FactSet などからシームレスにデータを取得できます。
利用可能性と移行
Claude Sonnet 4.6 は、すべての Claude プラン、Claude Cowork、Claude Code、API、および主要なクラウドプラットフォームで利用可能です。無料ティアでは Sonnet 4.6 がデフォルトとなり、ファイルの作成、コネクタ、スキル、およびコンテキスト圧縮が含まれます。開発者は Claude API の claude-sonnet-4-6 という識別子を使用してモデルの使用を開始できます。
ユーザーと市場への影響
- 費用対効果の高いフロンティア・パフォーマンス – Sonnet 4.6 は、より低価格な Sonnet の価格設定で Opus に近い推論品質を提供し、重量級の AI ワークロードにおける実現可能なユースケースを拡大します。
- 自動化の拡大 – 成熟したコンピュータ使用能力により、カスタムコネクタの必要性が減少し、AI が UI を通じてレガシーソフトウェアと対話できるようになります。
- 長文コンテキスト推論 – 100万トークンのウィンドウにより、以前は不可能であった全文文書分析、広範なコードベースへのクエリ、および多段階の計画が可能になります。
- 安全性への姿勢 – 安全性テストとプロンプト・インジェクション軽減への継続的な重点化は、責任ある AI プロバイダーとしての Anthropic のポジショニングを強化します。
関連発表
- Fable 5 のバイオロジー・セーフガードの改善 – 詳細は Anthropic のブログをご覧ください。
- Mariano-Florentino (Tino) Cuéllar が最高グローバル・アフェアーズ・オフィサーとして Anthropic に加入 – 企業リーダーシップの更新情報。
Sources
- OriginalIntroducing Sonnet 4.6
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch