Anthropic Claude Code 使用报告 2026 年 6 月 – 关于代理式编程、专业能力与劳动力影响的发现
概要
Anthropic 分析了 2025 年 10 月至 2026 年 4 月期间约 40 万次 Claude Code 会话,发现用户在 Claude 执行任务时主导规划决策,成功率与各职业的专业软件工程师相当,而更高的领域专业知识能显著提升成果质量与任务价值。
研究概述
Anthropic 引入了一种保护隐私的框架,用于分析交互式、代理式编程会话。该数据集涵盖约 40 万次会话,来自约 23.5 万名用户,通过 Claude Code 的 CLI、Web UI 和桌面应用捕获。分析聚焦于三个维度:工作模式、决策分工 和 会话成功率,并将其与用户的专业能力和职业背景关联起来。
工作模式与任务构成
结论: 与编写相关的任务主导了 Claude Code 的使用,但非编码活动正在快速增长。
- 会话被划分为九种互斥的工作模式:构建、修复、测试、编排(以代码为中心)、运维(部署/监控)、理解 与 规划(对现有系统的分析),以及 分析 与 沟通(数据或文字内容)。
- 分布情况(图 1):56% 的会话涉及代码创建、修改或测试(其中 25% 为构建,26% 为修复,5% 为测试/编排)。软件运维占 17%,规划/探索占 14%,分析/沟通占 13%。
- 分类可靠性高:超过 90% 被标记为代码变更的会话,其对应的遥测数据也一致。
用户与 Claude 之间的劳动分工
结论: 用户决定 做什么(约 70% 的规划决策),而 Claude 决定 如何做(约 80% 的执行决策)。
- 决策归属:分类器解析会话记录,将每个决策标记为规划或执行,并归因于用户或 Claude。
- 平均占比:用户做出约 70% 的规划决策,但仅占约 20% 的执行决策。
- 每轮操作数:典型会话包含约 4 个提示-行动循环。每次用户提示平均触发约 10 次 Claude 操作(约 2400 个词的输出)。当 Claude 控制规划时,每轮操作数上升至约 16 次;当用户保留执行控制时,操作数降至约 8 次。
- 图 2 展示了规划与执行决策的分配情况。
专业水平与模型输出
结论: 专业水平更高的用户能激发更长、更丰富的 Claude 输出——专家用户每条提示可产生最多 12 次操作和 3200 个词,而新手仅约 5 次操作和 600 个词。
- 专业水平通过会话记录中的线索(指令精确度、验证请求、修正方向)在 5 级新手至专家量表上推断得出。
- 表 1(图 3)展示了来自公开 SWE-chat 数据集的典型新手与专家会话示例。
- 操作数与词数随专业水平单调递增;回归分析确认其显著性(p < 0.001),每提升一级专业水平,操作数增加 +9%,词数增加 +13%。
谁在使用 Claude Code?
职业分布
结论: 尽管与软件相关的职业是最大用户群体,但包括商业、艺术、管理与科学在内的多样化职业也频繁使用 Claude Code。
- 职业通过会话上下文(文件名、引用的资源、领域术语)推断,并映射至 23 个 SOC 职业类别。
- 在约 70% 的会话中可识别职业。主要类别包括:计算机与数学(最大)、商业与金融运营、艺术/设计/媒体、管理、生命/物理/社会科学。
- 非软件领域中增长最快的群体:管理、销售、法律。
工作类型演变
结论: 在七个月的时间窗口内,修复 类会话占比从 33% 下降至 19%,而 运维、编写 和 分析 类会话数量均翻倍。
- 图 4 跟踪了各类模式的占比,显示向端到端代理式任务(部署、数据分析、文档生成)的转变趋势。
- 估算的经济价值(基于自由职业市场费率)整体上升 27%,其中构建、运维和修复任务各自增长约 30–40%。
成功率与专业能力的作用
结论: 用户专业能力越高,与验证成功越强相关;从新手到中级阶段的提升带来的收益最大。
- 成功率定义:两阶段分类器首先判断用户是否达成目标(成功、部分成功、失败、无明确目标)。另一验证器寻找硬性信号(git 提交、拉取请求合并、测试通过、用户明确确认)。验证成功需同时满足两者。
- 无明确目标的会话(约占数据的 7.7%)被排除在成功率分析之外。
- 成功率(图 5):
- 新手:15% 验证成功,77% 至少部分成功。
- 中级/专家:28–33% 验证成功,91–92% 部分成功。
- 在遇到困难的会话中(失败信号 >3),验证成功率从新手的 4% 提升至专家的 15%;部分成功从 60% 上升至约 80%。
- 放弃(失败 + 无代码行)在新手会话中占 19%,而更高专业水平者为 5–7%。
职业 vs. 专业能力
结论: 职业背景的影响远小于专业能力;不同职业间的成功率差异仅几个百分点。
- 所有会话中的验证成功率:软件相关用户为 30%,其他职业为 26%。
- 在代码生成会话中,验证成功率分别为 34%(软件)与 29%(其他);部分成功率均超过 88%。
- 图 6 显示,十大职业群体的验证成功率均落在软件工程师的 7 分范围内。管理类职业在验证成功率上略优于工程师,可能因使用更清晰的确认语言。
对劳动力市场的启示
结论: 代理式编程降低了对正式编程背景的要求,但放大了领域专业知识的价值;适度的专业能力即可带来大部分收益,而深度精通仅带来边际提升。
- 拥有强领域知识的用户能通过更少的指令引导 Claude 完成更多工作,从而实现更高成功率和更高价值的任务。
- 劳动分工表明,编程代理充当 实现引擎,而人类提供 问题定义 与 领域判断。
- 若未来模型进一步降低专业门槛,我们或将看到软件生产在所有职业中更广泛地普及,从而重塑技能需求。
局限性与未来工作
- 未衡量真实世界结果(如生成代码部署后的使用情况)。
- 排除了非交互式 Claude Code 使用(如批量生成);未来框架将纳入此类活动。
- 所有分类依赖模型驱动的会话分析;尽管遥测交叉验证显示高度一致,但大规模人工验证仍具挑战性。
- 持续监控将追踪随着模型自主性增强,专业能力回报是否递减。
参考文献
- Hitzig, Z., Massenkoff, M., Lyubich, E., Zhang, S., Heller, R., & McCrory, P. (2026). Agentic coding and persistent returns to expertise. Anthropic. https://www.anthropic.com/research/claude-code-expertise
- 以往关于自主性测量的研究:https://www.anthropic.com/research/measuring-agent-autonomy
- CLIO 保护隐私的分析框架:https://www.anthropic.com/research/clio
- SWE-chat 数据集:https://huggingface.co/datasets/SALT-NLP/SWE-chat
所有引用图表均来自原始 Anthropic 报告。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch