Anthropic 经济指数:来自 Claude 3.7 Sonnet 的洞察
Anthropic 通过 Anthropic 经济指数发布了其第二份研究报告,分析了 Claude 3.7 Sonnet 发布后 100 万条匿名的 Claude.ai 对话。研究结果表明,编程、教育和科学领域的用量占比有所适度增加,而 AI 增强(augmentation)与自动化(automation)之间的整体平衡保持稳定。
职业用量模式的转变
自 Claude 3.7 Sonnet 推出以来,特定职业类别中的用量比例出现了可衡量的增长。最显著的绝对增长发生在计算机和数学职业中(+3%),教育和科学领域也出现了显著的百分比增长。
Anthropic 将这些转变归因于三个潜在因素:
- Claude 3.7 Sonnet 改进的编程基准测试。
- AI 在更广泛经济领域中的持续扩散。
- 将编程能力应用于非编程领域,或通用模型能力的意外提升。
扩展思维模式的使用情况
Claude 3.7 Sonnet 的“扩展思维”(extended thinking)模式主要用于技术和创造性问题的解决。数据分析显示,与特定高技能角色相关的任务在采用该功能方面处于领先地位:
- 计算机和信息研究科学家: ~10% 用量
- 软件开发人员: ~8% 用量
- 多媒体艺术家: ~7% 用量
- 视频游戏设计师: ~6% 用量
增强 vs. 自动化趋势
AI 用量仍以增强为主,占总用量的 57%。虽然整体比例保持不变,但这些交互的内部构成发生了变化,特别是“学习”交互(用户寻求信息或解释)从大约 23% 增加到 28%。
按职业划分的差异
增强与自动化之间的平衡因职业类别而异:
- 高度增强型: 社区和社会服务任务(包括教育和指导咨询)的增强比例接近 75%。
- 平衡型: 生产和计算机/数学职业更接近增强与自动化 50-50 的分配。
交互模式示例
特定职业根据其任务性质表现出不同的交互模式:
- 任务迭代: 文案撰写者和编辑表现出最高水平的任务迭代,即人类与模型共同撰写内容。
- 指令性行为: 翻译人员和口译人员表现出最高水平的指令性行为,即模型以极少的人类参与完成任务。
- 学习: 图书管理员表现出最高比例的学习交互,约为 56%。
自下而上的用量分类法
为了捕捉超出美国劳工部 O*NET 数据库范围的使用案例,Anthropic 引入了一种由 630 个细粒度集群组成的自下而上的分类法。该数据集识别了 Claude.ai 的特定、小众应用,例如:
- 创建具有交互式可视化的物理模拟。
- 提供关于电池技术和充电系统的指导。
- 解决字体选择和实现中的故障。
- 处理代码和数据库中的时区逻辑。
- 协助水管理系统和基础设施项目。
方法论与数据可用性
Anthropic 使用其隐私保护分析工具 Clio 来将对话映射到 O*NET 任务。在本报告中,Clio 由 Claude 3.7 Sonnet 提供支持,Anthropic 指出这提高了分类准确性。分析过滤掉了被安全分类器标记的对话,但没有根据职业相关性进行过滤,以保留自下而上的分类法数据。
所有用于这些分析的数据集,包括 O*NET 任务到思维模式的映射以及自下而上的分类法,均可在 Hugging Face 上免费下载。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch