Anthropic Claude Code 6月2026年利用報告 – エージェント型コーディング、専門性、労働への影響に関する調査結果

まとめ

Anthropicは2025年10月から2026年4月までの約40万回のClaude Codeセッションを調査し、ユーザーが計画を担当しClaudeが実行を担当していること、成功率がさまざまな職業のプロフェッショナルなソフトウェアエンジニアと同等であること、そして高い分野専門性が結果とタスクの価値を大幅に向上させることを発見した。


調査概要

Anthropicは、インタラクティブでエージェント型のコーディングセッションを分析するプライバシー保護型フレームワークを導入した。データセットは約23.5万人のユーザーから得られた約40万回のセッションをカバーしており、Claude CodeのCLI、Web UI、デスクトップアプリから収集されたものである。分析は、作業モード意思決定の分担セッションの成功の3つの次元に焦点を当て、それらをユーザーの専門性と職業と結びつけて検証した。


作業モードとタスク構成

結論:コード作成に関連する作業がClaude Codeの利用の中心を占めるが、非コード作業の割合も急速に増加している。

  • セッションは9つの排他的な作業モードに分類される:構築修正テストオーケストレーション(コード中心)、運用(デプロイメント/モニタリング)、理解計画(既存システムの分析)、分析コミュニケーション(データまたは文章)。
  • 分布(図1):セッションの56%がコードの作成、変更、またはテストに関わっている(構築25%、修正26%、テスト/オーケストレーション5%)。ソフトウェアの運用は17%、計画/探索は14%、分析/コミュニケーションは13%である。
  • 分類の信頼性は高い:コード変更と見なされたセッションの90%以上が、対応するテレメトリと一致している。

ユーザーとClaude間の労働分担

結論:ユーザーは「何を構築するか」(計画意思決定の約70%)を決定する一方、Claudeは「どのように構築するか」(実行意思決定の約80%)を決定している。

  • 意思決定の帰属:分類器がトランスクリプトを解析し、各意思決定を計画または実行に分類し、ユーザーまたはClaudeに帰属させる。
  • 平均割合:ユーザーは計画意思決定の約70%を担当するが、実行意思決定のわずか20%にとどまる。
  • 1ターンあたりのアクション数:通常のセッションでは約4回のプロンプト・アクションサイクルがある。各ユーザーのプロンプトは約10回のClaudeアクション(約2,400語の出力)を引き起こす。Claudeが計画を制御する場合、1ターンあたりのアクション数は約16に増加するが、ユーザーが実行を制御する場合、アクション数は約8に低下する。
  • 図2は計画と実行の意思決定の割合を可視化している。

専門性レベルとモデル出力

結論:専門性の高いユーザーは、Claudeからより長く豊かな出力を引き出す——専門家は1プロンプトあたり最大12アクション、3,200語を生成するのに対し、初心者は5アクション、600語にとどまる。

  • 専門性は、トランスクリプトの手がかり(指示の正確さ、検証リクエスト、修正の方向性)に基づき、5段階の初心者〜専門家スケールで推定される。
  • 表1(図3)は、公開されたSWE-chatデータセットから抽出した初心者と専門家の例を示している。
  • アクション数と語数は専門性に比例して増加する。回帰分析により有意性(p < 0.001)が確認され、専門性レベルごとにアクション数が+9%、語数が+13%増加することが示された。

誰がClaude Codeを使っているのか?

職業分布

結論:ソフトウェア関連の職業が最大の利用層であるが、ビジネス、芸術、経営、科学など多様な職業が定期的にClaude Codeを活用している。

  • 職業はトランスクリプトの文脈(ファイル名、参照されるアーティファクト、分野用語)から推定され、23のSOCカテゴリにマッピングされる。
  • 職業は約70%のセッションで特定可能である。上位カテゴリは:コンピュータ・数学、ビジネス・財務業務、芸術/デザイン/メディア、経営、生命・物理・社会科学。
  • 非ソフトウェア系で最も成長が速いグループ:経営、営業、法務。

作業タイプの進化

結論:7か月間の期間中に、修正セッションの割合は33%から19%に低下した一方、運用作成分析セッションの割合はそれぞれ約2倍に増加した。

  • 図4はモードの割合を追跡し、エンドツーエンドのエージェント型タスク(デプロイメント、データ分析、ドキュメント生成)へのシフトを示している。
  • フリーランス市場のレートをもとに推定した経済的価値は全体で27%上昇し、構築、運用、修正の各タスクでそれぞれ30〜40%の増加を記録した。

成功指標と専門性の役割

結論:ユーザーの専門性が高いほど、検証済みの成功に強く相関する。特に初心者から中級者に移行する段階で最大の向上が見られる。

  • 成功の定義:2段階の分類器が、ユーザーが目的を達成したかどうか(成功、部分的成功、失敗、明確な目的なし)を判断する。別途、検証器がハードなシグナル(gitコミット、プルリクエストマージ、テスト通過、ユーザーの明示的承認)を確認する。検証済み成功には両方が必要である。
  • 明確な目的のないセッション(データの約7.7%)は、成功分析から除外される。
  • 成功率(図5)
    • 初心者:15%の検証済み成功、77%が少なくとも部分的成功。
    • 中級/専門家:28〜33%の検証済み成功、91〜92%が部分的成功。
  • 困難に直面したセッション(失敗シグナルが3つ以上)では、検証済み成功率が初心者で4%から専門家で15%に上昇し、部分的成功率は60%から約80%に上昇する。
  • 放棄(失敗+コード0行)は初心者セッションの19%で発生するが、専門性が高い層では5〜7%にとどまる。

職業 vs. 専門性

結論:職業よりも専門性のほうが重要であり、職業間の成功率の差は数パーセントにとどまる。

  • 全セッションにおける検証済み成功率:ソフトウェア関連ユーザーは30%、他の職業は26%。
  • コード生成セッションでは、検証済み成功率はソフトウェア系34%、他職業29%。部分的成功率は両者とも88%以上。
  • 図6は、10大職業グループがすべてソフトウェアエンジニアの7ポイントの範囲内にあることを示している。経営職は、明確な確認表現が多いため、検証済み成功率でエンジニアをわずかに上回っている可能性がある。

労働市場への影響

結論:エージェント型コーディングは、正式なコーディング経験の重要性を低下させる一方で、分野専門性の価値を高める。わずかな専門性でも大きな利益が得られ、深い熟練度はわずかな追加効果しかもたらさない。

  • 強い分野知識を持つユーザーは、Claudeに1回の指示でより多くの作業を実行させることができ、結果として成功確率が上がり、より高価値なタスクを遂行できる。
  • 労働分担の結果から、コーディングエージェントは実装エンジンとして機能し、人間は問題の定式化分野判断を提供していると見られる。
  • 将来のモデルが専門性の障壁を下げるならば、すべての職業においてソフトウェア開発の利用が広がり、スキル要求が再構築される可能性がある。

限界と今後の課題

  • 実世界の成果(生成コードのデプロイ後利用など)は測定されていない。
  • 非インタラクティブなClaude Code利用(例:バッチ生成)は除外されている。今後のフレームワークでこの活動を捉える予定である。
  • すべての分類はモデルベースのトランスクリプト分析に依存している。テレメトリのクロスチェックでは高い一致が確認されているが、大規模な人間による検証は依然として困難である。
  • 将来、モデルがより自律的になると専門性のリターンが減少するかを継続的にモニタリングする予定である。

参考文献


参照されたすべての図は、オリジナルのAnthropicレポートから再現されています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch