Project Fetch: Evaluating Claude's Impact on Robotics Task Performance
TL;DR
Anthropic 進行了「Project Fetch」,這是一項提升研究,旨在確定 Claude 是否能幫助非專家編寫四足機器人程式,以檢索 Beach Ball。結果顯示,使用 AI 的團隊完成任務的速度顯著快於沒有 AI 存取權的團隊,並且在實現完全自主化方面取得了實質性的進展。
Experiment Design and Methodology
Anthropic 研究人員將八名非機器人學專家分為兩組: 「Team Claude」 (有 AI 存取權) 與 「Team Claude-less」 (沒有 AI 存取權)。這些團隊被分配了三個難度遞增的機器人狗操作階段:
- Phase One: 使用製造商提供的控制器將球帶回特定區域。
- Phase Two: 建立與機器人的電腦連接,存取板載感測器 (video 和 lidar),並開發用於檢索的自定義軟體程式。
- Phase Three: 開發一個程式讓機器人能夠自主檢測並檢索球。
Key Findings: AI Uplift in Robotics
Performance and Speed
Team Claude 在任務完成度和效率方面展現了明顯的優勢。對於兩組團隊都完成的任務,Team Claude 成功所需的時間大約是 Team Claude-less 所需時間的一半。雖然 Team Claude-less 完成了 6/8 項任務,但 Team Claude 完成了 7/8 項任務。
Technical Advantages
Claude 在硬體互動的初始階段提供了最顯著的提升:
- Connectivity: Team Claude 在探索連接方法方面更有效率,並避免了被錯誤的線上文件誤導,而 Team Claude-less 則過早地放棄了最簡單的連接方法。
- Sensor Integration: Team Claude 更容易存取 lidar 感測器數據,而 Team Claude-less 則在這一任務上掙扎直到一天結束。
- Program Quality: 雖然 Team Claude 寫程式的時間比他們更長,但最終產出的軟體更優越,提供了串流影片饋送 (streaming video feed) 而非 Team Claude-less 所使用的斷續靜態圖像。
Trade-offs and "Side Quests"
實驗顯示,AI 輔助可能會導致工作流程的分歧。Team Claude 寫的程式碼量比 Team Claude-less 多了大約九倍。雖然這讓他們能夠並行地探索多種方法,但這也導致了「side quests」和對主要目標的干擾。例如,一名成員開發了一個機器人的自然語言控制器,這並非主要任務所要求的。
Impact on Team Dynamics and Morale
Emotional Expression and Confusion
對音訊轉錄文本的定量分析顯示,Team Claude-less 表達困惑的頻率是 Team Claude 的兩倍。他們的對話內容通常較為負面,且他們報告感覺在沒有使用慣用的 AI 工具的情況下,其編碼技能有所下降。
Collaboration Styles
兩組團隊展現了不同的工作模式:
- Team Claude: 成員主要與其個人 AI 助手夥伴合作,朝著目標追求並行的路徑。
- Team Claude-less: 成員之間進行了更深層次的策略討論,且提問的數量比使用 AI 的團隊多出 44%。
Limitations and Future Implications
Study Limitations
Anthropic 提到研究中的幾項限制,包括樣本量較小 (兩個團隊)、持續時間較短 (一天),以及使用了已經熟悉 AI 的 Anthropic 員工作為便利樣本。
The Path to Autonomy
Anthropic 主張「提升往往先於自主化」,這意味著 AI 現在協助人類進行機器人學任務的能力,是未來 AI 獨立執行這些任務的前兆。這項能力被強調為 Anthropic 責任性擴展政策 (Responsible Scaling Policy) 中的一個關鍵門檻,因為涉及硬體的自主 AI 研發 (R&D) 可能會導致 AI 能力的快速且不可預測的進展。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch