Anthropic 经济指数:来自 Claude 3.7 Sonnet 的洞察

Anthropic 通过 Anthropic 经济指数发布了其第二份研究报告,分析了 Claude 3.7 Sonnet 发布后 100 万条匿名的 Claude.ai 对话。研究结果表明,编程、教育和科学领域的用量占比有所适度增加,而 AI 增强(augmentation)与自动化(automation)之间的整体平衡保持稳定。

职业用量模式的转变

自 Claude 3.7 Sonnet 推出以来,特定职业类别中的用量比例出现了可衡量的增长。最显著的绝对增长发生在计算机和数学职业中(+3%),教育和科学领域也出现了显著的百分比增长。

Anthropic 将这些转变归因于三个潜在因素:

  1. Claude 3.7 Sonnet 改进的编程基准测试。
  2. AI 在更广泛经济领域中的持续扩散。
  3. 将编程能力应用于非编程领域,或通用模型能力的意外提升。

扩展思维模式的使用情况

Claude 3.7 Sonnet 的“扩展思维”(extended thinking)模式主要用于技术和创造性问题的解决。数据分析显示,与特定高技能角色相关的任务在采用该功能方面处于领先地位:

  • 计算机和信息研究科学家: ~10% 用量
  • 软件开发人员: ~8% 用量
  • 多媒体艺术家: ~7% 用量
  • 视频游戏设计师: ~6% 用量

增强 vs. 自动化趋势

AI 用量仍以增强为主,占总用量的 57%。虽然整体比例保持不变,但这些交互的内部构成发生了变化,特别是“学习”交互(用户寻求信息或解释)从大约 23% 增加到 28%。

按职业划分的差异

增强与自动化之间的平衡因职业类别而异:

  • 高度增强型: 社区和社会服务任务(包括教育和指导咨询)的增强比例接近 75%。
  • 平衡型: 生产和计算机/数学职业更接近增强与自动化 50-50 的分配。

交互模式示例

特定职业根据其任务性质表现出不同的交互模式:

  • 任务迭代: 文案撰写者和编辑表现出最高水平的任务迭代,即人类与模型共同撰写内容。
  • 指令性行为: 翻译人员和口译人员表现出最高水平的指令性行为,即模型以极少的人类参与完成任务。
  • 学习: 图书管理员表现出最高比例的学习交互,约为 56%。

自下而上的用量分类法

为了捕捉超出美国劳工部 O*NET 数据库范围的使用案例,Anthropic 引入了一种由 630 个细粒度集群组成的自下而上的分类法。该数据集识别了 Claude.ai 的特定、小众应用,例如:

  • 创建具有交互式可视化的物理模拟。
  • 提供关于电池技术和充电系统的指导。
  • 解决字体选择和实现中的故障。
  • 处理代码和数据库中的时区逻辑。
  • 协助水管理系统和基础设施项目。

方法论与数据可用性

Anthropic 使用其隐私保护分析工具 Clio 来将对话映射到 O*NET 任务。在本报告中,Clio 由 Claude 3.7 Sonnet 提供支持,Anthropic 指出这提高了分类准确性。分析过滤掉了被安全分类器标记的对话,但没有根据职业相关性进行过滤,以保留自下而上的分类法数据。

所有用于这些分析的数据集,包括 O*NET 任务到思维模式的映射以及自下而上的分类法,均可在 Hugging Face 上免费下载。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch