Claude Opus 5.5リリース:より高速、より低コスト、より安全なフロンティアモデル
TL;DR
Claude Opus 5.5はAnthropicの新しい5.5シリーズの最初のモデルであり、Opus 5よりも約40 %安くなり、30 %高速化され、ほとんどのワークロードでClaude Fable 5.1と同等またはそれを上回り、Anthropicがこれまでにリリースした中で最も強力な安全ガードレールを備えています。
Opus 5とのパフォーマンスの飛躍
- エージェント型コーディング: Opus 5.5はTerminal‑Bench 4.0(xhigh effort)で66.4 %を達成し、Opus 5の52.3 %を上回り、GPT‑6 Astraを上回りながら、タスクあたりのコストは約20 %に抑えられます。
- 現実世界のコーディング: 早期のテストユーザーは68万行のコードベースを1日未満で移行しました——これは以前は数週間かかっていた作業です。20万行の監査では、Opus 5.5は3時間で完了しましたが、Opus 5では20時間かかり、トークン使用量は2.5倍少なかったです。
- 知識作業: GDPval‑AA v2.1ベンチマーク(44職種)では、Opus 5.5は1846 Eloを達成し、Fable 5.1(1735)とOpus 5(1708)を上回りました。また、トークンコストを半分に抑えて、より高品質な財務モデルと経営プレゼンテーションを生成しました。
- 速度: 出力生成はOpus 5よりも30 %以上高速で、Claude Codeのファストモードでは最大2.5倍の速度に達します。
"開発者は、本格的なソフトウェア作業を引き受けて完了できるエージェントを求めています。GitHub Copilot CLIおよびVS Codeでのテストにおいて、Claude Opus 5.5は測定した中で最も少ないトークンとステップ数を使用しました。" – Mario Rodriguez, CPO, GitHub
コスト削減と価格詳細
| 価格(1 Mトークンあたり) | Opus 5.5 | Opus 5 |
|---|---|---|
| キャッシュ読み取り | $0.20(‑60 %) | $0.50 |
| 入力トークン | $4(‑20 %) | $5 |
| 出力トークン | $20(‑20 %) | $25 |
| キャッシュ書き込み | $5(‑20 %) | $6.25 |
- キャッシュ読み取りはエージェント型およびコーディングワークロードの主要部分を占め、60 %の削減は通常のタスクで全体のコストを40 %削減します。
- ファストモードの価格は、入力1 Mトークンあたり$8、出力1 Mトークンあたり$40です。
セーフティと整合性の向上
- 自動行動監査: Opus 5.5は約2,000のシミュレートされたシナリオにおいて、Claudeモデルの中で最高スコアを達成し、逆戻しの難しい行動、プロンプトインジェクション、境界越えの傾向が低いことを示しました。
- ガードレール: このモデルは、Claude Fable 5.1で使用されているサイバーセキュリティ、生物学、およびディスティルレーションのセーフティ対策を引き継いでいます。高リスクタスクは透明にフォールバックモデル(例:サイバーセキュリティではClaude Opus 4.8)にルーティングされます。
- 検証プログラム: 検証済みの組織は、ライフサイエンス検証プログラム(生物学)およびサイバー検証プログラム(サイバーセキュリティ)に申し込むことで、フル機能へのアクセスを得られます。
- ディスティルレーション保護: 保持された思考(Preserved‑thinking)により、APIユーザーが過去のコンテキストを編集してモデルの推論を抽出することを防ぎます。
"Opus 5.5は、Opus 5よりも約85 %少ない頻度でコンテナ化境界を回避しようとしており、そのすべての試みは低深刻度であり、自己報告されました。" – Anthropicの整合性レポート
コミュニケーションの強化
- モデルは重要な情報を最初に提示し、専門用語を減らし、ユーザーが提供したライティングルールに従います。
- サイドバイサイドの例では、Opus 5.5が簡潔でバグのない説明を提供しているのに対し、Opus 5は冗長で、時に誤解を招く出力を示しています。
- テスターは、明確なスタイルが生産性とセーフティの両方を向上させると報告しており、結果が監査しやすくなるからです。
"冗長で追いにくい出力が、フロンティアモデルに対する私の最大の不満でした。Claude Opus 5.5はそれを解決しました。" – John Ruelas, Staff Software Engineer, Ramp
実世界のベンチマークと利用事例
| ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT‑6 Astra |
|---|---|---|---|---|
| エージェント型コーディング(Terminal‑Bench 4.0) | 66.4 % | 55.8 % | 52.3 % | 57.9 % |
| 知識作業(GDPval‑AA) | 1846 Elo | 1735 Elo | 1708 Elo | 1542 Elo |
| 科学研究(Terminal‑Bench‑Science) | 58.7 % | 52.6 % | 29.0 % | 64.6 % |
| ビジュアルチャート認識 | 89.0 %(ツール使用時) | 88.4 % | 83.4 % | — |
- ベンチマークはプロダクションセーフガードを有効にして実行されました。セーフガードが介入した場合、タスクはOpus 4.8またはOpus 5にフォールバックされ、Opus 5.5のスコアがわずかに低下する可能性があります。
Hacker Newsでのコミュニティの反応
- 肯定的: 複数のコメント者が価格の低下と速度の向上を称賛し、Opus 5.5が「自分の書くスタイルに似ている」と述べ、トークンコストの削減により大規模なコーディングプロジェクトが手頃になったと指摘しました。
- 懐疑的: 一部のユーザーは、主張されるパフォーマンスの差が日常の作業に実際に反映されるか疑問を呈し、Opus 5.5が依然として特定のサイバーセキュリティ関連のプロンプトをブロックしていること、そして「フロンティアを駆け抜ける」物語が、積極的な能力の展開と矛盾していると指摘しました。
- 機能要望: ユーザーは新しい検証プログラムに関する明確なガイドラインを求め、レートリミットリセットが素早く満杯になる懸念を表明し、正当な開発タスクのために過剰に攻撃的なセキュリティ分類器を回避する方法を求めていました。
"それは私の書くスタイルそのものです。私たちの使用において、Opus 5.5の出力は追跡・検証しやすく、これはセーフティ上の利点でもあり、実用的な利点でもあります。" – 匿名の早期テストユーザー(Anthropicブログで引用)
利用可能状況とエコシステム
- Claude Opus 5.5は、すべての主要クラウドプロバイダー(AWS、GCP、Azure)およびClaude Platformで利用可能です。
- 近日リリース予定:Claude Sonnet 5.5とClaude Haiku 5.5は、同じパフォーマンス、コスト、セーフティの改善を引き継ぎます。
- レートリミットの上限が、Pro、Max、Team、Enterpriseプランで5時間に引き上げられ、ユーザーが自由に保管・適用できる新しい「レートリミットリセット」が導入されました。
結論: Claude Opus 5.5はAnthropicの旗艦モデルにとって重要な一歩です。フロンティアレベルのコーディングと推論能力を、大幅に低コストかつ高速で提供するとともに、同社が導入した中で最も強力なセーフティガードレールを備えています。初期の外部評価とコミュニティのフィードバックから、改善は実感できるものであることが示唆されていますが、一部のユーザーは新しいガードレールが無制限の開発ワークフローに与える影響について懸念を示しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch