Anthropic Claude Code 使用报告 2026 年 6 月 – 关于代理式编程、专业能力与劳动力影响的发现

概要

Anthropic 分析了 2025 年 10 月至 2026 年 4 月期间约 40 万次 Claude Code 会话,发现用户在 Claude 执行任务时主导规划决策,成功率与各职业的专业软件工程师相当,而更高的领域专业知识能显著提升成果质量与任务价值。


研究概述

Anthropic 引入了一种保护隐私的框架,用于分析交互式、代理式编程会话。该数据集涵盖约 40 万次会话,来自约 23.5 万名用户,通过 Claude Code 的 CLI、Web UI 和桌面应用捕获。分析聚焦于三个维度:工作模式决策分工会话成功率,并将其与用户的专业能力和职业背景关联起来。


工作模式与任务构成

结论: 与编写相关的任务主导了 Claude Code 的使用,但非编码活动正在快速增长。

  • 会话被划分为九种互斥的工作模式:构建修复测试编排(以代码为中心)、运维(部署/监控)、理解规划(对现有系统的分析),以及 分析沟通(数据或文字内容)。
  • 分布情况(图 1):56% 的会话涉及代码创建、修改或测试(其中 25% 为构建,26% 为修复,5% 为测试/编排)。软件运维占 17%,规划/探索占 14%,分析/沟通占 13%。
  • 分类可靠性高:超过 90% 被标记为代码变更的会话,其对应的遥测数据也一致。

用户与 Claude 之间的劳动分工

结论: 用户决定 做什么(约 70% 的规划决策),而 Claude 决定 如何做(约 80% 的执行决策)。

  • 决策归属:分类器解析会话记录,将每个决策标记为规划或执行,并归因于用户或 Claude。
  • 平均占比:用户做出约 70% 的规划决策,但仅占约 20% 的执行决策。
  • 每轮操作数:典型会话包含约 4 个提示-行动循环。每次用户提示平均触发约 10 次 Claude 操作(约 2400 个词的输出)。当 Claude 控制规划时,每轮操作数上升至约 16 次;当用户保留执行控制时,操作数降至约 8 次。
  • 图 2 展示了规划与执行决策的分配情况。

专业水平与模型输出

结论: 专业水平更高的用户能激发更长、更丰富的 Claude 输出——专家用户每条提示可产生最多 12 次操作和 3200 个词,而新手仅约 5 次操作和 600 个词。

  • 专业水平通过会话记录中的线索(指令精确度、验证请求、修正方向)在 5 级新手至专家量表上推断得出。
  • 表 1(图 3)展示了来自公开 SWE-chat 数据集的典型新手与专家会话示例。
  • 操作数与词数随专业水平单调递增;回归分析确认其显著性(p < 0.001),每提升一级专业水平,操作数增加 +9%,词数增加 +13%。

谁在使用 Claude Code?

职业分布

结论: 尽管与软件相关的职业是最大用户群体,但包括商业、艺术、管理与科学在内的多样化职业也频繁使用 Claude Code。

  • 职业通过会话上下文(文件名、引用的资源、领域术语)推断,并映射至 23 个 SOC 职业类别。
  • 在约 70% 的会话中可识别职业。主要类别包括:计算机与数学(最大)、商业与金融运营、艺术/设计/媒体、管理、生命/物理/社会科学。
  • 非软件领域中增长最快的群体:管理、销售、法律。

工作类型演变

结论: 在七个月的时间窗口内,修复 类会话占比从 33% 下降至 19%,而 运维编写分析 类会话数量均翻倍。

  • 图 4 跟踪了各类模式的占比,显示向端到端代理式任务(部署、数据分析、文档生成)的转变趋势。
  • 估算的经济价值(基于自由职业市场费率)整体上升 27%,其中构建、运维和修复任务各自增长约 30–40%。

成功率与专业能力的作用

结论: 用户专业能力越高,与验证成功越强相关;从新手到中级阶段的提升带来的收益最大。

  • 成功率定义:两阶段分类器首先判断用户是否达成目标(成功、部分成功、失败、无明确目标)。另一验证器寻找硬性信号(git 提交、拉取请求合并、测试通过、用户明确确认)。验证成功需同时满足两者。
  • 无明确目标的会话(约占数据的 7.7%)被排除在成功率分析之外。
  • 成功率(图 5):
    • 新手:15% 验证成功,77% 至少部分成功。
    • 中级/专家:28–33% 验证成功,91–92% 部分成功。
  • 在遇到困难的会话中(失败信号 >3),验证成功率从新手的 4% 提升至专家的 15%;部分成功从 60% 上升至约 80%。
  • 放弃(失败 + 无代码行)在新手会话中占 19%,而更高专业水平者为 5–7%。

职业 vs. 专业能力

结论: 职业背景的影响远小于专业能力;不同职业间的成功率差异仅几个百分点。

  • 所有会话中的验证成功率:软件相关用户为 30%,其他职业为 26%。
  • 在代码生成会话中,验证成功率分别为 34%(软件)与 29%(其他);部分成功率均超过 88%。
  • 图 6 显示,十大职业群体的验证成功率均落在软件工程师的 7 分范围内。管理类职业在验证成功率上略优于工程师,可能因使用更清晰的确认语言。

对劳动力市场的启示

结论: 代理式编程降低了对正式编程背景的要求,但放大了领域专业知识的价值;适度的专业能力即可带来大部分收益,而深度精通仅带来边际提升。

  • 拥有强领域知识的用户能通过更少的指令引导 Claude 完成更多工作,从而实现更高成功率和更高价值的任务。
  • 劳动分工表明,编程代理充当 实现引擎,而人类提供 问题定义领域判断
  • 若未来模型进一步降低专业门槛,我们或将看到软件生产在所有职业中更广泛地普及,从而重塑技能需求。

局限性与未来工作

  • 未衡量真实世界结果(如生成代码部署后的使用情况)。
  • 排除了非交互式 Claude Code 使用(如批量生成);未来框架将纳入此类活动。
  • 所有分类依赖模型驱动的会话分析;尽管遥测交叉验证显示高度一致,但大规模人工验证仍具挑战性。
  • 持续监控将追踪随着模型自主性增强,专业能力回报是否递减。

参考文献


所有引用图表均来自原始 Anthropic 报告。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch