Anthropic Project Fetch 第二階段

Claude Opus 4.7 在機器人控制方面超越人類團隊

Anthropic 的 Project Fetch 第二階段顯示,Claude Opus 4.7 能夠自主完成機器人程式設計與設定任務,速度遠超人類團隊。在使用市售四足機器人(「機器狗」)的對比測試中,該模型在所有完成的任務上均比最快的人類團隊快約 20 倍,展現出 AI 從協助人類的角色,轉變為在物理環境中獨立運作的趨勢。

實驗設計與方法論

Project Fetch 第二階段透過將 Claude Code 的適應性思考設為最大努力,評估 Claude Opus 4.7 的自主能力。實驗聚焦於第一階段人類曾執行的任務子集,包括:

  • 連接至機器狗的視訊攝影機。
  • 連接至機器狗的 Lidar 傳感器。
  • 開發一個程式以手動控制機器狗。
  • 寫出一個程式來偵測一個 beach ball(沙灘球)。
  • 監控機器狗在空間中的移動路徑。

研究人員的角色僅限於提供初始提示、插入筆電,以及批准命令與任務轉換。模型未被評估其使用實體控制器的能力,也未測量使用 Claude 程式化控制器撿起球所需時間。

關鍵性能指標

Claude Opus 4.7 在速度、效率與可靠性方面,相比前一階段的人類團隊有顯著提升:

速度與效率

針對所有參與者均完成的四項任務,Opus 4.7 僅耗時 9 分鐘 35 秒。相比之下,「Team Claude」(由 Claude Opus 4.1 協助的人類團隊)耗時 181 分鐘,而「Team Claude-less」(無 AI 協助的人類團隊)則耗時 361 分鐘。這表示 Opus 4.7 的速度約為 AI 協助團隊的 18.9 倍,以及無協助團隊的 37.7 倍。

程式碼量

Opus 4.7 為達成目標所撰寫的程式碼量顯著較少,僅寫下 1,045 行程式碼,而 Team Claude 則撰寫了 10,309 行。這顯示該模型在識別與傳感器介接的最佳路徑,以及首次撰寫功能性程式碼方面更具效率。

可靠性

在三次試驗中,表現時間相對穩定,但因模型偶爾選擇次佳或過時的物件偵測演算法,導致部分變異。

當前在物理控制上的限制

儘管在程式設定方面表現成功,Claude Opus 4.7 在高精度物理互動方面仍顯不足,特別是專案中的「撿取」部分。模型無法精確地將沙灘球推回起始基地,此任務需要閉迴路反饋系統來即時感知錯誤並調整輸入。

Anthropic 指出,雖然人類透過練習可以掌握此技能,但模型的表現控制不佳且未能成功。然而,實驗室觀察到,具備機器人經驗的研究人員可成功撰寫出自主撿取的程式,顯示若提供更多支援架構,現有的 Claude 模型最終有可能達成此目標。

對物理自主 AI 的意義

Anthropic 總結,這些結果是通用擴展的自然產物,而非專門針對提升機器人能力的刻意設計。研究結果顯示出朝向「物理自主 AI」的發展趨勢,即模型能相對輕鬆地使用市售的實體工具。

此進展類似於 AI 程式設計的演變歷程,模型從協助人類進行字串替換,進展到獨立管理軟體工具。Anthropic 認為,硬體領域也正經歷類似的演變:從模型協助人類,到人類協助模型,最終走向模型自主運作。

Sources

相關