Anthropic 关于 AI 在情报目标定位与常规武器领域的能力的调研研究

Anthropic 的 Frontier Red Team 开发了新的评估方法,用于衡量 AI 在战术情报目标定位和常规武器开发方面的能力。研究表明,前沿模型现在可以执行以往需要高度训练的人类专家才能完成的任务——例如从碎片化数据中识别个人以及设计无人机引导软件——从而降低了威胁行为者进行监视和开发精确武器的门槛。

AI 在情报目标定位中的能力

情报目标定位涉及情报周期的“发现”(find)和“固定”(fix)阶段:即识别感兴趣的目标并将其锁定在精确的位置和时间。Anthropic 发现,AI 模型可以显著降低与这些过程相关的劳动力和成本。

身份关联与分类

通过使用来自墨西哥城和加尔各答虚构场景的模拟社交媒体内容,Anthropic 评估了模型将不同的数字人格关联到同一个人并将其分类到感兴趣类别中的能力。

  • 性能表现: Mythos Preview 脱颖而出,成为表现最佳的模型,其在实际表现与理论最大值之间的差距最小。Kimi K3 在简单和中等难度的任务中表现与前沿模型相当,但在具有更多噪声和更好操作安全性的更难样本上表现落后。
  • 效率: 模型展示了相对于人类的巨大速度优势。对于一个中位数为 37,000 字的样本——人类分析师大约需要 2.5 小时才能阅读完——Claude Mythos Preview 平均仅用 11 分钟就生成了完整的评估报告。

基于视觉和文本数据的地理定位

Anthropic 测试了模型在不依赖元数据或反向图像搜索的情况下,仅使用照片和文本来“固定”目标的能力。

  • 照片地理定位: 使用 YFCC100M Flickr 数据集,研究发现前沿模型正在接近超人类能力。Mythos Preview 和 Mythos 5 分别实现了 37.0 km 和 47.2 km 的中位距离误差,击败了最强的人类基准(GeoGuessr 冠军组选手在 151 km)。
  • 文本转地理定位: 使用 GeoText 语料库,要求模型根据其帖子内容来定位用户。Mythos Preview、Mythos 5 和 Opus 5 表现最佳,其中位数的家庭位置误差在 20-21 km 左右。研究发现,8% 的用户被可靠地定位在距离其家 1 km 以内,这通常是通过提及校园隶属关系、地方方言或特定场所实现的。

AI 在常规武器开发中的能力

Anthropic 评估了模型编写和迭代用于模拟四旋翼无人机的引导、导航与控制(GNC)软件的能力。这项研究侧重于武器开发的软件瓶颈,而非物理制造。

末端制导与打击率

模型被要求编写代码,仅使用前视摄像头、IMU 和气压计来感知、跟踪并打击目标车辆。

  • 结果: Opus 5 在停放的、高可见度的目标上实现了 80% 的打击率,并在所有九种设置下实现了 20% 的整体打击率。相比之下,Sonnet 5 的整体打击率仅为 0.7%。
  • 技术方法: Opus 5 通过实施较小的、迭代式的代码编辑(每次启动仅修改 9% 的行数,而 Mythos Preview 为 25%)并利用先进的解决方案,如比例导航、目标状态卡尔曼滤波(Kalman filters)以及在飞行前使用其内部物理模型测试控制器,从而表现优于其他模型。

载荷投放与 GPS 拒止环境下的导航

  • 载荷投放: 模型被评估在 5 米致命半径内投放模拟载荷的能力。虽然大多数模型在面对静态目标时都能成功,但 Opus 5 是唯一一个在最难设置(在阵风下摆动的目标)中保持稳定性的模型,在 28% 的出航任务中取得了成功。
  • GPS 拒止飞行: 模型被测试在 GPS 被干扰或欺骗时导航至航点的方式。前沿模型(Opus 5, Mythos 5, Mythos Preview)能够检测到传感器数据不一致,并使用 IMU 进行航位推算(dead-reckon),而较弱的模型如 Sonnet 5 和 Kimi K3 则继续信任被欺骗的 GPS 信号,导致最终位置与目的地偏差超过 100 米。

对安全与政策的影响

Anthropic 结论认为,AI 替代稀缺的人类专家劳动力在情报和军事领域的能力,为隐私和全球稳定性带来了显著风险。

模型安全防护措施

由于存在滥用证据,Anthropic 的 Safeguards 团队已经实施了专门用于检测和拦截与武器开发相关的请求的新分类器。由于这些工程能力具有双重用途,实验室指出,分类器并不会完美,但对于风险缓解而言是必要的。

开源权重模型风险

研究强调了开源权重模型中一个令人担忧的趋势。虽然像 Kimi K3 这样的模型通常落后于前沿模型,open-weights 模型的民主化通过开源权重模型提供军事相关专业知识,这值得仔细考虑并进行更强大的安全研究。

地缘战略考量

Anthropic 对这些发现提出了几项政策和战略响应建议:

  • 算力治理: 保护在算力(芯片和芯片制造设备)方面的优势,以限制威权主义 AI 的进展。
  • 法律更新: 更新前 AI 时代法律和检查机制,以应对专家级人类劳动力与大规模监视之间的脱钩。
  • 防御性 AI: 开发前沿模型智能以协助防御者在隐私和物理安全方面的保护,类似于网络安全领域采取的方法。

Sources