Anthropic Claude 3.5 Sonnet 计算机使用能力

Anthropic 发布了公开测试版,使最新版本的 Claude 3.5 Sonnet 能够使用计算机。该模型可以遵循用户命令来移动光标、点击屏幕位置以及通过虚拟键盘输入文本,从而使其能够像人类一样与软件进行交互,而不是依赖于定制的工具。

Technical Implementation and Research

Claude 3.5 Sonnet 通过结合多模态和推理能力来实现计算机使用功能。该模型会解释用户屏幕的截图,并计算移动光标和点击正确位置所需的精确像素坐标。

开发过程中的关键技术见解包括:

  • Pixel-Level Accuracy: 训练模型准确计算像素对于可靠的鼠标命令至关重要,这解决了 LLM 在精确计数方面的常见难题。
  • Generalization: 该模型展示了快速的泛化能力,从在计算器和文本编辑器等简单软件上进行训练,转变为根据书面提示执行复杂的逻辑步骤序列。
  • Self-Correction: 在执行任务期间,观察到模型在遇到障碍时会进行自我纠正并重试操作。
  • Performance Benchmarks: 在 OSWorld 评估中,Claude 3.5 Sonnet 获得了 14.9% 的分数,显著高于排名第二的 AI 模型 7.7% 的分数,尽管仍远低于人类水平(70-75%)。

Safety Framework and Risk Mitigation

Anthropic 将计算机使用能力归类为降低现有认知技能门槛的一种方式,而不是增加这些技能。因此,根据公司的 Responsible Scaling Policy,更新后的 Claude 3.5 Sonnet 仍处于 AI Safety Level 2 级别。

Primary Safety Concerns

  • Prompt Injection: 由于 Claude 解释来自联网计算机的截图,它容易受到提示词注入攻击,即屏幕上的恶意内容可能会覆盖用户指令。
  • Intentional Misuse: 为了防止滥用,Anthropic 实施了分类器来标记滥用行为。具体而言,公司正在监控与选举相关的活动,并实施了系统来引导模型远离注册网络域名、与政府网站交互或在社交媒体上发布内容。

Anthropic 认为,在 AI Safety Level 2 阶段引入计算机使用功能,可以让公司在模型达到更高的安全级别(Level 3 或 4)之前解决安全问题,因为在那些级别中,灾难性风险更为普遍。

Current Limitations and Future Direction

Anthropic 将计算机使用功能的当前状态描述为从“让工具适应模型”到“让模型适应工具”的转变。然而,目前仍存在若干局限性:

  • Input Constraints: 该模型目前无法执行诸如拖拽或缩放等操作。
  • Observation Gaps: Claude 将屏幕视为截图的“翻页书”而非连续的视频流,这可能导致错过短暂的通知或操作。
  • Reliability: 该能力目前速度较慢且容易出错,例如有报告称模型会意外停止屏幕录制或偏离任务去浏览无关内容。

随着该能力的演进,Anthropic 打算在速度、可靠性和非开发者的易用性方面进行改进。

Sources

相关