Anthropic 项目 Fetch 第二阶段
Claude Opus 4.7 在机器人控制方面超越人类团队
Anthropic 的项目 Fetch 第二阶段表明,Claude Opus 4.7 能够自主完成机器人编程和设置任务,速度远超人类团队。在使用现成的四足机器人(“机器狗”)进行的对比测试中,该模型在所有完成的任务上比最快的人类团队快约 20 倍,展示了人工智能从充当人类助手向在物理环境中独立运行的转变。
实验设计与方法
项目 Fetch 第二阶段通过将 Claude Code 的自适应思维设置为最大努力,评估了 Claude Opus 4.7 的自主能力。实验聚焦于第一阶段中人类曾执行的一组任务,包括:
- 连接到机器狗的视频摄像头。
- 连接到机器狗的激光雷达传感器。
- 开发一个程序以手动控制机器狗。
- 编写一个程序来检测一个沙滩球。
- 监控机器狗在空间中的行进路径。
研究人员的角色仅限于提供初始提示、插入笔记本电脑,并批准命令和任务切换。模型未被评估其使用物理控制器的能力,也未测量使用 Claude 编程的控制器抓取球所需的时间。
关键性能基准
Claude Opus 4.7 在速度、效率和可靠性方面相比前一阶段的人类团队表现出显著提升:
速度与效率
对于所有参与者均完成的四项任务,Opus 4.7 用时 9 分 35 秒。相比之下,“Team Claude”(由 Claude Opus 4.1 协助的人类团队)耗时 181 分钟,而“Team Claude-less”(无 AI 协助的人类团队)耗时 361 分钟。这使得 Opus 4.7 的速度比 AI 协助的人类团队快约 18.9 倍,比无协助的人类团队快约 37.7 倍。
代码量
Opus 4.7 为实现目标编写的代码量显著更少,仅生成 1,045 行代码,而 Team Claude 编写了 10,309 行代码。这表明该模型在识别与传感器接口的最优路径以及首次尝试就编写出功能代码方面更为高效。
可靠性
在三次试验中,性能时间保持相对一致,尽管由于模型偶尔选择次优或过时的目标检测算法,出现了一些波动。
当前在物理控制方面的局限性
尽管在程序化设置方面取得成功,Claude Opus 4.7 在高精度物理交互方面仍存在困难,特别是项目中的“抓取”环节。该模型无法精确地将沙滩球推回起始基座,而这一任务需要闭环反馈系统来实时感知误差并调整输入。
Anthropic 指出,虽然人类通过练习可以掌握这一技能,但该模型的尝试控制不佳且未能成功。然而,实验室观察到,具有机器人经验的研究人员能够成功编写出自主抓取的程序,这表明通过更多支持,当前的 Claude 模型最终可能实现这一目标。
对物理自主 AI 的启示
Anthropic 总结认为,这些结果是通用扩展的自然产物,而非专门针对提升机器人能力的刻意努力。这些发现预示着“物理自主 AI”的发展轨迹,即模型能够相对轻松地使用现成的物理工具。
这一进程类似于 AI 编程的发展历程,模型从协助人类进行字符串替换,演变为独立管理软件工具。Anthropic 认为,硬件领域很可能正经历类似的演变:从模型辅助人类,到人类辅助模型,最终到模型自主运行。
Sources
- OriginalProject Fetch: Phase two
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch