Anthropic Claude 3.5 Sonnet 電腦使用能力
Anthropic 已發布公開測試版,讓最新版本的 Claude 3.5 Sonnet 能夠使用電腦。該模型可以遵循用戶指令來移動游標、點擊螢幕位置,並透過虛擬鍵盤輸入文字,使其能夠像人類一樣與軟體互動,而不是依賴客製化的工具。
Technical Implementation and Research
Claude 3.5 Sonnet 透過結合多模態與推理能力來實現電腦使用功能。該模型會解讀用戶螢幕的截圖,並計算移動游標與點擊正確位置所需的精確像素座標。
開發過程中的關鍵技術洞察包括:
- Pixel-Level Accuracy: 訓練模型精確計算像素對於可靠的滑鼠指令至關重要,這解決了大型語言模型(LLM)在精確計數方面的常見難題。
- Generalization: 該模型展現了快速的泛化能力,從在計算機和文字編輯器等簡單軟體上進行訓練,轉變為根據書面提示執行複雜的邏輯步驟序列。
- Self-Correction: 在執行任務時,觀察到模型在遇到障礙時會自我修正並重試操作。
- Performance Benchmarks: 在 OSWorld 評估中,Claude 3.5 Sonnet 獲得了 14.9% 的分數,顯著高於次佳的 AI 模型 7.7%,儘管仍遠低於人類水平(70-75%)。
Safety Framework and Risk Mitigation
Anthropic 已將電腦使用能力歸類為降低現有認知技能門檻的方式,而非增加這些技能。因此,根據公司的《責任規模政策》(Responsible Scaling Policy),更新後的 Claude 3.5 Sonnet 仍維持在 AI 安全等級 2(AI Safety Level 2)。
Primary Safety Concerns
- Prompt Injection: 由於 Claude 會解讀來自連網電腦的截圖,因此它容易受到提示注入攻擊(prompt injection attacks),即螢幕上的惡意內容可能會覆蓋用戶指令。
- Intentional Misuse: 為了防止濫用,Anthropic 已實施分類器來標記濫用行為。具體而言,公司正在監控與選舉相關的活動,並已實施系統來引導模型遠離註冊網域、與政府網站互動或在社群媒體上發文。
Anthropic 主張,在 AI 安全等級 2 引入電腦使用功能,可以讓公司在模型達到更高安全等級(等級 3 或 4)之前,先處理安全問題,因為在那些等級中,災難性風險更為普遍。
Current Limitations and Future Direction
Anthropic 將目前電腦使用功能的狀態描述為從「讓工具適應模型」轉向「讓模型適應工具」。然而,目前仍存在幾項限制:
- Input Constraints: 該模型目前無法執行拖曳或縮放等操作。
- Observation Gaps: Claude 將螢幕視為截圖的「翻頁書」而非連續的影片串流,這可能導致遺漏短暫的通知或動作。
- Reliability: 目前該功能速度較慢且容易出錯,已有報告指出模型會意外停止螢幕錄製,或偏離任務去瀏覽無關的內容。
隨著功能的演進,Anthropic 打算在速度、可靠性以及非開發者的實作難易度方面進行改進。
Sources
- OriginalDeveloping a computer use model
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch