Claude Sonnet 5 リリースノート:エージェント機能の強化と価格設定
Claude Sonnet 5 はエージェントワークフローにおける自律性を向上させます
Claude Sonnet 5 は Sonnet ファミリーの中で最もエージェント的なモデルとして設計されており、自律的な計画、ブラウザおよびターミナルツールの使用、複雑なマルチステップ実行が可能です。中位の Sonnet モデルとハイエンドの Opus クラスモデルとの性能ギャップを縮め、特に推論、コーディング、知的作業の向上を目指しています。
主な性能向上
Sonnet 5 はエージェント検索(BrowseComp)およびコンピュータ使用(OSWorld-Verified)評価において、Sonnet 4.6 に対して確実な改善を提供します。最大精度を求める場合は Opus 4.8 が依然として最適な選択ですが、Sonnet 5 は「effort levels」を調整することで、コストと性能のバランスを取ることができます。
早期アクセスパートナーは、フォローアップにおいて大幅な改善を報告しています。その例は以下の通りです:
- ソフトウェアエンジニアリング: 「messy」な技術的文脈での継続的なコーディングとデバッグの処理。
- エンドツーエンドオートメーション: 停滞せずに複数のタスク(例:Salesforce のティアを更新し、アナウンスを送信)を完了する。
- 自律的バグ修正: 明示的なプロンプトなしで、再現テストを書き、単一のパスで修正を実装する。
- ブラウンフィールドコード: 症状をパッチするのではなく、レガシーコードベースで失敗の根本原因を追跡する。
安全性とサイバーセキュリティのガードレール
Sonnet 5 は Sonnet 4.6 と比較して、望ましくない振る舞い、幻覚、媚び行為の発生率が低いことを示しています。エージェントコンテキストにおけるプロンプトインジェクション攻撃や悪意あるリクエストに抵抗するよう特別に最適化されています。
サイバーセキュリティの制限
Anthropic は、Sonnet 5 が Opus 4.8 や Mythos 5 に比べて危険なサイバーセキュリティタスクを実行する能力が大幅に低いことを明言しています。Firefox 147 用のソフトウェアエクスプロイト開発を含む評価では、Sonnet 5 は完全に機能するエクスプロイトを一つも作成できませんでした。Sonnet 4.6 に比べて部分的な成功率がわずかに上昇したのは、一般的な知能向上によるものであり、Anthropic はデフォルトでリアルタイムのサイバー保護を有効にしています。
価格と利用可能性
Claude Sonnet 5 はすべてのプラン(Free、Pro、Max、Team、Enterprise)で利用可能で、Free と Pro ユーザーのデフォルトモデルです。また、Claude Code と Claude Platform に統合されています。
トークン価格
| 期間 | 入力トークン(1M あたり) | 出力トークン(1M あたり) |
|---|---|---|
| Through Aug 31, 2026 | $2 | $10 |
| After Aug 31, 2026 | $3 | $15 |
トークン化に関する注意: Sonnet 5 は更新されたトークナイザーを使用しています。その結果、同じ入力が以前のバージョンに比べておおよそ 1.0–1.35 倍のトークンにマッピングされ、リクエストあたりの実質的なコストに影響します。
コミュニティ分析と反論
Anthropic が Sonnet 5 を Opus のコスト効果の高い代替として位置付ける一方で、Hacker News からのコミュニティフィードバックは、いくつかの重要なトレードオフを指摘しています:
コストパフォーマンス効率
複数のユーザーは、Sonnet 5 が高い「effort levels」ではパレート最適ではないと主張しています。
「タスクあたりのコストチャートは、私に対して中程度の effort level を超えて Sonnet 5 を使用すべきではないと示しています—同じコストであれば Opus の方が常に性能が優れています。」
エージェント型 vs. アシスト型開発
モデルが「agentic」開発(モデルが主導)に最適化されるにつれて、一部の開発者は「assisted」開発(人間が主導)の低下を報告しています。
「完全にエージェント型開発に最適化されたモデルほど、アシスト開発が悪化し、非常に厳格かつ具体的な指示にもかかわらず、過剰に動作し始めることが分かりました。」
比較ベンチマーク
独立したテスターは、他の最先端モデルと比較してさまざまな結果を指摘しています:
- GLM-5.2: 一部のユーザーは、Sonnet 5 がコーディングとエージェント能力において GLM-5.2 と同等であると報告していますが、より高速で冗長性が低い可能性があります。他のユーザーは、GLM-5.2 より価格性能が劣ると主張しています。
- 信頼性: 一部の報告では、Sonnet 5 が複雑な HPC カーネルで「spin」し、トークンを浪費することがあり、以前は Opus が成功していたと指摘されています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch