Claude Sonnet 5.5 リリースノート

Claude Sonnet 5.5 は速度、コスト、エージェント型コーディング性能において大幅な向上を実現

Claude Sonnet 5.5 は、日常的なタスク、バグ修正、ドキュメント作成に適した高性能モデルです。前バージョンの Sonnet 5 より 30% 速く、タスクあたり最大 30% 低コストでありながら、特にコーディングやプロフェッショナルな知識作業におけるエージェント機能に大幅な飛躍を遂げています。

パフォーマンスベンチマークと機能

Sonnet 5.5 は、いくつかの主要な評価項目において Sonnet 5 に対して劇的な改善を示しており、一部の性能はより強力な Claude Opus 5.5 に近づいています。

エージェント型コーディングとコンピュータ利用

Sonnet 5.5 はエージェント型コーディングにおいて大幅な向上を示し、Terminal-Bench 4.0 で 70.6% を記録したのに対し、Sonnet 5 は 10.3% でした。また、OSWorld 2.1(80.1% partial)および CursorBench 4.0(55.5%)でも強力なパフォーマンスを発揮しており、後者では Opus 5.5 とわずか 2 ポイントの差に留まっています。

知識作業と推論能力

GDPval-AA ベンチマーク(44 の職業にわたる現実世界のタスクをテスト)では、Sonnet 5.5 は 1844 を記録し、Opus 5.5(1846)にほぼ並び、Sonnet 5(1449)を大きく上回りました。また、長期的な知識作業および視覚的チャート認識(Chartography)においても GPT-6 Sol を上回りました(61.6%)。

比較表

ベンチマーク Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
FrontierCode 1.1 (Main) 46.2% (Max)² 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487⁴
Humanity's Last Exam 64.5% (tools) 54.9% (tools) 67.7% (tools) —
OSWorld 2.1 80.1% (partial) 57.0% (partial) 81.8% (partial) —
Chartography 61.6% (no tools) 15.6% (no tools) 64.4% (no tools) 53.6%⁴

¹ 注:Terminal-Bench の差は、Opus 5.5 がより高い安全対策フォールバック率(10%)を示しているため、部分的に説明されます。Sonnet 5.5 は 1.5% です。

コストと速度効率

Sonnet 5.5 は Sonnet 5 と同じトークン単価を維持しながら、同じ結果を得るために必要なトークン数を減らすことで、タスクあたりの総コストを削減しています。

価格構造

100万トークンあたりの価格 Claude Sonnet 5.5 Claude Opus 5.5
キャッシュ読み取り $0.20 $0.20
キャッシュ書き込み $2.50 $5
入力トークン $2 $4
出力トークン $10 $20

効率の向上

  • 速度:Sonnet 5 より 30% 以上高速に出力を生成。
  • タスクコスト:トークン効率の向上により、Sonnet 5 よりタスクあたり最大 30% 低コスト。
  • 努力レベル:ユーザーは速度とコスト、品質のバランスを取るために、努力レベル(Low、Medium、High、Xhigh、Max)を調整できます。Claude アプリのデフォルトは Medium です。

セーフティ、整合性、およびセーフガード

Sonnet 5.5 は、特にサイバーセキュリティ分野で能力が向上したことに伴い、高度なセーフガードを導入しています。

  • サイバーセキュリティ:Opus 5.5 と同等の能力を持つため、Sonnet 5.5 は初めてサイバーセーフガードを搭載してリリースされた Sonnet モデルです。高リスクのリクエストは Sonnet 5 にフォールバックされます。
  • 蒸留防止:工業規模の攻撃によるモデル能力の抽出を防ぐため、Sonnet 5.5 は推論の抽出を防ぐセーフティ分類器を搭載し、「保持された思考」の範囲を拡大しています。
  • 整合性:自動化された行動監査の結果、Sonnet 5.5 は誠実さ、悪用への抵抗性、整合性において Sonnet 5 と同等またはそれ以上です。

コミュニティの洞察と反論

公式ベンチマークは強力ですが、Hacker News からのコミュニティのフィードバックは、いくつかの実用的な懸念や観察を示しています。

  • Opus との価値提案の比較:いくつかのユーザーは、高努力レベルでの Sonnet 5.5 の実用性に疑問を呈し、タスクあたりのコストが類似または低くても、Opus 5.5 がより高い精度を提供する傾向があると指摘しました。
  • 思考トークンの制限:一部のユーザーは、「Max」努力レベルで、128,000 トークンの思考トークン制限を消費しても最終的な応答が生成されないケースがあると報告しました。
  • セーフガードの干渉:サイバーバリデーションプログラムのユーザーは、セーフガードが過剰に厳しく、承認されたバウンティ作業を Cyber 違反として誤検出するケースがあると報告しました。
  • パフォーマンスの後退:一部のユーザーは、特定のニッチ分野(例:珍しいプログラミング言語)でパフォーマンスが低下していると報告しており、Sonnet 5.5 が Sonnet 5 よりも粘り強く対応する傾向が薄いと指摘しました。
  • 競合状況:コメントでは、Sonnet 5.5 は Sonnet 5 に対して飛躍的な進化を遂げているものの、DeepSeek や OpenAI の Luna などの競合モデルに比べて依然として大幅に高価であると指摘されています。

"Epic の初期テストでは、Claude Sonnet 5.5 はより上位のモデルに期待される品質基準をクリアしました… 新モデルはゲームプレイシステムのアーキテクチャに数万行のコードを処理し、応答を迅速に保ち、数時間にわたるタスクを処理し、より制御的なプロンプトなしで成果を出しました。" — Daniel Vogel, COO, Epic Games

Sources

関連