Claude Opus 5 リリースノート

Anthropic は、日常的な高効率利用を想定した Claude Opus 5 をリリースしました。このモデルは、Claude Fable 5 に近い最先端の知能を提供しつつ、タスクあたりのコストを半分に抑えることができます。現在、Claude Max のデフォルトモデルとなっており、Claude Pro で利用可能な最も強力なモデルです。

コーディングおよび知識作業における最先端のパフォーマンス

Claude Opus 5 は、ソフトウェアエンジニアリングおよび問題解決に関するいくつかの主要な評価で、新たな最先端の結果を達成しており、コストを抑えた上で、前世代モデルや競合モデルを上回っています。

ソフトウェアエンジニアリングベンチマーク

  • Frontier-Bench v0.1: Opus 5 は他のすべてのモデルを上回り、Opus 4.8 のパフォーマンスを2倍以上にし、タスクあたりのコストも削減しています。
  • CursorBench 3.2: 最大努力レベルで、Opus 5 は Fable 5 のピークスコアに0.5%以内で近づき、タスクあたりのコストは半分です。同じコストで、高、xhigh、max の努力レベルすべてにおいて、他のすべてのモデルを上回っています。
  • OSWorld 2.0: Opus 5 は、任意のコストで他のすべてのモデルを上回り、Fable 5 の最高スコアを約3分の1のコストで上回っています。

知識作業および問題解決

  • ARC-AGI 3: Opus 5 のスコアは、この新しい問題解決評価において、次に良いモデルの3倍です。
  • Zapier AutomationBench: Opus 5 は、同じタスクあたりのコストで、次に良いモデルの1.5倍の合格率を達成しています。最低の努力設定でも、他のすべてのモデルよりも多くのタスクを合格させています。
  • Frontier-Bench および GDPval-AA: Opus 5 は、これらのコーディングおよび知識作業の評価において、新たな最先端の記録を樹立しています。

科学研究および視覚的機能

Opus 5 は、特に生命科学分野における科学的調査の能力に顕著な向上を遂げており、視覚的出力機能も強化されています。

生命科学分野の改善

Opus 5 は、バイオインフォマティクス、構造生物学、有機化学を含むすべての生命科学評価で、Opus 4.8 を上回っています。主な成果は以下の通りです:

  • 有機化学: スペクトロスコピーデータから分子構造を推定する能力が、Opus 4.8 に対して10.2ポイント向上しています。
  • タンパク質研究: タンパク質配列の変異が機能に与える影響を予測する能力が、7.7ポイント向上しています。

エージェント的行動および実用的応用

Claude Opus 5 は、より高い自律性、徹底性、そして反復によって自身の作業を検証できる能力を示しています。

技術的ケーススタディ

  • 自律的なツール利用: Frontier-Bench のタスクにおいて、Opus 5 は直接視認が制限された場合に、独自のコンピュータビジョンパイプラインを記述し、生のピクセルから幾何学情報を抽出して 3D FreeCAD モデルを再構築しました。
  • バグの修正: Opus 5 は、人気のあるオープンソースパッケージマネージャーに存在する実際のバグの根本原因を特定し、以前のコミュニティパッチが見逃していたエッジケースを修正しました。
  • インフラ開発: あるトレーディングファームのエンジニアは、Opus 5 を使って1回のセッションで市場データフィードを構築し、検証用の独自のテストハーネスも作成しました。

業界からのフィードバック

早期アクセスパートナーは、特定の強みを強調しています:

  • Devin: 難しいデバッグおよび根本原因分析において優れた実績。
  • Lovable: 最も困難なエージェント型コーディングタスクにおいて、Opus 4.7 より22%向上し、ばらつきも低く抑えられています。
  • Box: Opus 4.8 より全体で8%のパフォーマンス向上を達成。データ分析では11%、デューデリジェンスワークフローでは17%の向上。
  • Legal Agents: 最大推論レベルと同程度のパフォーマンスを発揮しながら、Opus 4.8 より26%少ないトークンで生成しています。

一貫性、安全性、サイバーセキュリティ

Opus 5 は、Anthropic がこれまでに開発した中で最も一貫性が高いモデルとされており、Opus 4.8、Sonnet 5、Fable 5 よりも Claude の憲法に忠実です。

行動監査およびリスク低減

  • 一貫性スコア: 自動化された行動監査において、Opus 5 は全体的な不一致行動で2.3のスコアを記録し、最近のモデルの中でも最低です。
  • サイバーセキュリティの制限: Opus 5 は脆弱性の特定において Mythos 5 に近い性能を発揮していますが、その脆弱性の悪用においては Mythos 5 と比べて大幅に劣っています(OSS-Fuzz ベンチマークで示されています)。
  • 生物学研究: Opus 5 は、一般に利用可能なモデルの中で最も能力が高いものの、長期間にわたる自律的な研究タスクでは Mythos 5 に劣っています。

セーフガードおよび分類器

  • サイバー分類器: Fable 5 よりも制限が緩やかで、ソースコード内の脆弱性の発見を許可しますが、バイナリベースのスキャン、ペネトレーションテスト、エクスプロイト生成はブロックします。これらの分類器は、Fable 5 のものと比べて85%少ない頻度で介入する見込みです。
  • フォールバック: Opus 5 や Fable 5 のセーフティ分類器によってフラグが立てられたリクエストは、API を介して別のモデルに自動的にルーティングできるようになりました。

価格および利用可能範囲

Claude Opus 5 は以下の価格で、すべてのプラットフォームで利用可能です:

  • 入力トークン: 100万トークンあたり $5
  • 出力トークン: 100万トークンあたり $25
  • Fast Mode: 基本価格の2倍で利用可能。デフォルト速度の約2.5倍の速度を提供します。

ベータ機能リリース

  • 会話中のツール変更: 開発者は、プロンプトキャッシュを無効にせずに、会話中に利用可能なツールを変更できるようになりました。
  • 自動フォールバック: API ユーザーは、ブロックされないように、フラグが立てられたリクエストを別のモデルにルーティングできます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch