Claude Opus 4.6 リリースノート

Anthropicは、エージェンティックなコーディング、長期的な計画策定、および複雑な多角的な推論を強化するために設計された、同社の最もスマートなモデルの重要なアップグレードであるClaude Opus 4.6をリリースしました。このアップデートでは、ベータ版として1Mトークンのコンテキストウィンドウが導入され、新しいエフォート設定を通じて、開発者がモデルの推論の深さとコストを細かく制御できるようになります。

最先端のパフォーマンスとベンチマーク

Claude Opus .6は、いくつかの高複雑性評価において業界をリードしており、知識労働やエージェンティックなタスクにおける優れた能力を示しています。

  • Agentic Coding: Terminal-Bench 2.0評価において最高スコアを達成しました。
  • Multidisciplinary Reasoning: Humanity’s Last Examにおいて、他のすべてのフロンティアモデルをリードしています。
  • Knowledge Work: 金融および法務ドメインにおけるパフォーマンスを評価するGDPval-AAにおいて、Opus 4.6はOpenAIのGPT-5.2を約144 Eloポイント、前身であるClaude Opus 4.5を190ポイント上回っています。
  • Information Retrieval: 見つけにくいオンライン情報を特定する能力を測定するBrowseCompにおいて、他のすべてのモデルを上回っています。

長期コンテキスト能力と「Context Rot」

Opus 4.6は、「context rot」(長い会話におけるパフォーマンスの低下)の問題に対処しています。MRCR v2 needle-in-a-haystackベンチマークの8-needle 1Mバリアントにおいて、Opus 4.6は76%を記録し、Sonnet 4.5の18.5%を大幅に上回りました。これにより、モデルは数十万トークンにわたって情報を追跡し、ドリフトを最小限に抑えながら、埋もれた詳細をより効果的に取得できるようになります。

開発者向けの技術的強化

Anthropicは、開発者が長時間稼働するエージェントを実装し、コストを管理する方法を最適化するために、Claude Platform上でいくつかの新しい機能を導入しました。

適応型思考とエフォートコントロール

開発者は、low, medium, high (default), and maxの4つのエフォートレベルを使用して、知能、速度、およびコストのバランスを管理できるようになりました。

さらに、adaptive thinkingにより、モデルはバイナリなオン/オフの切り替えを必要とせず、文脈上の手がかりに基づいて、拡張思考を使用するかどうかを自律的に決定できるようになります。

コンテキスト管理と出力

  • Context Compaction (Beta): エージェントが長いタスクの途中でコンテキストウィンドウの制限に達するのを防ぐため、この機能は、設定可能な閾値に達したときに、古いコンテキストを自動的に要約して置き換えます。
  • 1M Token Context (Beta): これは、1Mトークンのウィンドウをサポートする最初のOpusクラスのモデルです。200kトークンを超えるプロンプトは、プレミアム価格($10/$37.50 per million input/output tokens)が適用されます。
  • 128k Output Tokens: モデルは、最大128kトークンの出力を生成できるようになり、大きなタスクを複数のリクエストに分割する手間を必要としなくなります。

製品統合とエージェンティックなワークフロー

Opus 4.6は、いくつかの生産性ツールに統合されており、より自律的な作業を可能にします。

  • Claude Code: リサーチ・プレビュー版において「agent teams」機能を搭載しており、複数のエージェントが並行して作業し、コードベースのレビューなどのタスクをに対してエージェントが自律的に連携・調整を行えます。

  • Office Integration: ExcelでのClaudeは、多段階の変更や非構造化データの取り込みを処理できるようにアップグレードされました。PowerPointでのClaudeは、Max, Team, and Enterpriseプラン向けにリサーチ・プレビュー版として提供されており、モデルがレイアウト、フォント、およびスライドマスターに基づいてスックデッキを作成できるようになります。

  • Cowork: Opus 4.6はCoworkのリサーチ・プレビュー版を駆動しており、調査、財務分析、およびドキュメント作成にわたる自律的なマルチタスクを可能にします。

安全性と安全性への適合

システムカードによると、Opus 4.6は、他のフロンティアモデルと同等、あるいはそれ以上の安全性プロファイルを維持しています。欺瞞や追従性(sycophancy)を含む、不整合な行動の発生率は低く、最近のClaudeモデルの中で最も低い過剰拒否(over-refusals)率を示しています。

モデルの強化されたサイバーセキュリティ能力に関連するリスクをを軽減するため、Anthropicは、有害なレスポンスを検知知検知するために6つの新しいサイバーセキュリティ・プローブを実装し、モデルのアプリケーションを、オープンソースソフトウェアの脆弱性のパッチ適用などのサイバー防御用途に焦点を当てています。

Sources

関連