Anthropic Claude Sonnet 5 の発表
TL;DR
Claude Sonnet 5 は、Anthropic の最新の Sonnet クラスのモデルであり、より低価格で、安全性を向上させつつ、Opus クラスに近いエージェント機能(プランニング、ツール使用、コーディング、ナレッジワーク)を提供します。
なぜ Sonnet 5 はよりエージェント的(agentic)なのか?
Sonnet 5 は「これまでで最もエージェント的な Sonnet モデル」と説明されています。自律的に計画を作成し、ブラウザやターミナルなどの外部ツールを呼び出し、以前はより大規模で高価なモデルを必要としていたマルチステップのタスクを実行できます。前身である Sonnet 4.6 と比較して、Sonnet 5 は推論、ツール使用、コーディング、およびナレッジワークのパフォーマンスにおいて測定可能な向上を示しています。
他の Anthropic モデルと比較したパフォーマンス
- Opus 4.8 に肉薄: 発表内のベンチマークテーブルでは、Sonnet 5 のさまざまな評価スコアは、より上位のモデルである Opus 4.8 に匹敵していますが、Sonnet クラスの価格設定を維持しています。
- Sonnet 4.6 からの向上: エージェント型検索 (BrowseComp) およびコンピュータ使用 (OSWorld-Verified) タスク全体において、Sonnet 5 は一貫して Sonnet 4.6 を上回り、Opus 4.8 よりも幅広いコストパフォーマンスの範囲を提供します。
- コスト効率: 入力トークン 100 万件あたり 2 ドル、出力トークン 100 万件あたり 10 ドルで、Sonnet 5 は、特に一部のタスクで Opus 4.8 に匹敵する中程度の作業レベルにおいて、ドルあたりの高いパフォーマンスを提供します。
開発者からの実際のフィードバック
早期アクセスパートナーからは、以前の Sonnet モデルでは断念していた複雑なマルチステップのワークフローを、Sonnet 5 が完了させたと報告されています。代表的な引用は以下の通りです:
"Claude Sonnet 5 は、マルチステップのソフトウェアエンジニアリング作業に対して、強力な実行レイヤーを我々のエージェントに提供してくれます。複雑な技術的コンテキストにおいても、継続的なコーディング、ツール使用、およびデバッグをうまく処理します。"
"我々は Claude Sonnet 5 に、Salesforce のアカウントティアの更新と、エンタープライズ連絡先へのローンチアナウンスの送信という2部構成のジョブを渡しましたが、最後まで完了しました。以前は途中で止まっていました。"
"Claude Sonnet 5 は、より少ない労力でより多くのことを成し遂げます。出力の質は同じまま、そこに到達するためのステップが少なくなりました。不適切な要求に対しては、クリーンかつ一貫して拒否します。"
"Claude Sonnet 5 にバグの調査を依頼しました。促されることなく、再現テストを書き、修正を実装し、その後、変更なしでバグが再発することを確認するためにスタッシュしました。これらすべてを一度のパスで行いました。"
これらの逸話は、継続的なプロンプトなしに、集中力を維持し、規約に従い、検証済みのコード変更を生成するモデルの能力を示しています。
安全性プロファイル
Anthropic のデプロイ前の安全性評価は以下のことを示しています:
- 全体的な望ましくない動作の低下: Sonnet 4.6 よりも、ハルシネーション(幻覚)や追従性(sycophancy)が少なく、悪意のある要求に対する拒否機能が向上しています。
- エージェントの悪用に対する Opus 4.8 より高い安全性: ただし、広範な自動行動監査において、Sonnet 5 は Mythos プレビューや Opus 4.8 よりもわずかにミスマッチ率が高い状態にあります。
- サイバーセキュリティ能力の抑制: Firefox ベースのテストにおいて、Sonnet 5 が完全なエクスプロイトを開発できたことは一度もありません。部分的な成功率は低いままです。それにもかかわらず、一般的な知能の向上により、Sonnet 4.6 よりはわずかに高くなっています。
サイバー関連の能力のわずかな向上により、Anthropic は Sonnet 5 に、デフォルトで有効化されたリアルタイムのサイバー保護機能を搭載しています。これは Opus 4.7/4.8 で使用されているものと同一ですが、Fable 5 のものよりは制限が緩くなっています。
利用可能性と価格
- 一般提供: Sonnet 5 は Free および Pro プランのデフォルトモデルであり、Max、Team、および Enterprise の顧客も利用可能です。
- 価格: 入力トークン 100 万件あたり 2 ドル、出力トークン 100 万件あたり 10 ドル(2026 年 8 月 10 日時点で確定)。より高度な使用をサポートするため、Claude Chat、Cowork、Claude Code、および Claude Platform 全体でレート制限が引き上げられました。
- API アクセス: 開発者は
claude-sonnet-5という識別子を使用して、Claude API 経由でモデルを呼び出すことができます。
AI エコシステムへの影響
- エージェント型 AI の民主化: Sonnet ファミリーと Opus ファミリーの間のパフォーマンスの差を縮めることで、Anthropic は高品質な自律型エージェントをより幅広い開発者層にとって手頃なものにします。
- 競争圧力: Sonnet 5 によって確立されたコストパフォーマンスのフロンティアは、他のプロバイダーに、同様に能力の高い低コストのエージェント型モデルのリリースを促す可能性があります。
- 安全性のトレードオフ: 前の Sonnet と比較して安全性は向上していますが、モデルは依然としてトップティアの Opus モデルよりも安全性が低く、能力とアライメントの間の継続的なバランスを浮き彫りにしています。
すべての数値、図表、および直接引用は、Anthropic の公式 Claude Sonnet 5 発表およびシステムカードから引用されています。
Sources
- OriginalIntroducing Claude Sonnet 5
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch