Anthropic Interviewer: Scaling Qualitative Research on AI Integration

Anthropic 推出了 Anthropic Interviewer,这是一款由 AI 驱动的研究工具,旨在以前所未有的规模进行详细、自适应的定性访谈。通过自动化访谈过程,Anthropic 可以收集关于 AI 使用、情绪和未来预期的深度人类观点——这些数据在以前对于数千名参与者来说,手动收集过于耗时。

The Anthropic Interviewer Framework

Anthropic Interviewer 通过三阶段流水线运行,以在保持自然对话灵活性的同时确保研究的一致性。

1. Planning

该工具根据包含研究目标、假设和访谈最佳实践的系统提示词生成访谈细则。随后,人类研究人员与 AI 协作,审查并最终确定对话流程。

2. Interviewing

访谈通过 Claude.ai 界面实时进行,通常持续 10-15 分钟。AI 采用自适应方法,在遵循总体计划的同时,对参与者的离题话题和具体细节做出响应。

3. Analysis

人类研究人员与 AI 协作分析转录文本并提取研究问题的答案。Anthropic 还采用了一种独立的自动化 AI 分析工具,用于对涌现的主题进行聚类并量化它们在数据集中的普遍程度。

Key Findings from Professional AI Integration

为了测试该工具,Anthropic 对 1,250 名专业人士进行了访谈,其中包括普通劳动力样本 (N=1,000)、科学家 (N=125) 和创意工作者 (N=125)。结果突显了劳动力群体普遍乐观但保持谨慎的态度。

General Workforce Sentiment

大多数专业人士将 AI 视为生产力的提升,86% 的人报告称 AI 为他们节省了时间,65% 的人对 AI 在其工作中的作用表示满意。然而,也存在显著的紧张关系:

  • Identity vs. Routine: 员工通常希望将常规行政任务委派给 AI,同时保留定义其专业身份的核心任务。
  • Social Stigma: 69% 的专业人士提到与在工作中使用 AI 相关的社会污名,导致一些人向同事隐瞒其工作过程。
  • Future Anxiety: 55% 的人对 AI 对其未来的影响表示焦虑,尽管大多数人都有补救计划(例如,调整角色或设定界限)。

Creative Professionals

创意工作者报告了极高的生产力增益——97% 的人表示 AI 为他们节省了时间,68% 的人表示它提高了质量——但同时也面临着深刻的经济和身份认同问题。

  • Control Boundaries: 虽然所有 125 名参与者都表示希望保持控制权,但许多人承认在实践中,AI 经常驱动创意决策。
  • Economic Displacement: 对于人类创意身份的侵蚀以及特定领域的流失,例如工业配音,存在显著的担忧。
  • Peer Judgment: 70% 的创意工作者在应对关于在艺术创作中使用 AI 的同行评审压力方面感到挣扎。

Scientific Research

科学家表现出截然不同的采用模式,他们利用 AI 处理周边任务,而非核心研究。

  • Trust Barriers: 79% 的访谈中提到了信任和可靠性是采用 AI 的主要障碍。担忧包括幻觉 (hallucinations) 和“迎合性” (sycophancy),即 AI 迎合用户的感官偏好。
  • Usage Patterns: AI 主要用于文献综述、编程和撰写手稿,而不是用于假设生成或实验设计。
  • Low Displacement Fear: 与创意工作者不同,科学家通常不担心失业,理由是隐性知识 (tacit knowledge) 和现实世界的物理实验的必要性。

Augmentation vs. Automation

Anthropic 对 Interviewer 工具的自我报告数据与来自 Anthropic Economic Index 的观察行为进行了对比。在用户如何看待自己与 AI 的交互方式上,出现了一个显著的差异:

  • Self-Reported: 65% 的参与者将他们的 AI 使用方式描述为 augmentative (协作式) 且 35% 为 automative (自动化式)。
  • Observed Usage: 实际的 Claude 对话显示,两者几乎平分秋色,其中 47% 为增强式使用,49% 为自动化式使用。

Anthropic 认为这种差距可能存在的原因是用户在聊天结束后会优化 AI 的输出,或者因为专业人士认为自己的使用方式比原始对话模式所显示的更具协作性。

Limitations and Research Scope

Anthropic 指出该研究的初步阶段存在以下几项局限性:

  • Selection Bias: 参与者是通过众包平台招募的,这可能会使结果向更有 AI 经验的用户倾斜。
  • Demand Characteristics: 参与者意识到自己正在接受 AI 对 AI 的访谈,这可能会影响他们的回答。
  • Lack of Non-Verbal Cues: 作为一个纯文本工具,Interviewer 无法检测语气或肢体语言。
  • Global Generalizability: 样本主要反映了西方背景下的工作者。

尽管存在这些局限性,97.6% 的参与者对访谈体验的满意度评分在 5 分或更高(基于 7 分制),并且 99.12% 的人会向他人推荐这种形式。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch