awlevin/typesafe-computer-use

Computer use for about $0.0002 a step: OCR the screen, classify the next action with TypeSafe, click. macOS.

解決的問題

它提供了一種經濟高效且快速的方式,使用純英語目標來自動化 Mac 電腦。與將完整截圖發送給昂貴 LLM 的邊界模型不同,該項目通過使用小型專用分類器進行決策,並僅在需要自由文本輸入時調用寫作模型,從而降低了成本和延遲。

運作原理

系統在一個循環中運行,處理螢幕並確定下一個操作:

  1. 感知:它捕獲螢幕,使用 Vision OCR 讀取文字,並遍歷 macOS 輔助功能樹以查找帶標籤的控件。它採用快取系統,僅重新讀取螢幕上發生變化的磁貼,以節省 OCR 成本。
  2. 決策:它將處理後的螢幕狀態傳送到 TypeSafe 決策模型,該模型從一組互斥選項中選擇一個操作(例如,點擊項目、使用瀏覽器或輸入文字)。
  3. 操作:它透過 macOS API(Quartz、AppleScript、AXPress)執行確定性操作。
  4. 文字生成:獨立的「writer」模型僅針對特定任務(如為欄位撰寫文字或建議 URL)被調用。
  5. 最終答案:一旦達到目標或循環停止,一個更強大的模型會讀取最終螢幕以提供結果。

適用對象

macOS (14+) 上的開發者和進階使用者,他們希望構建或使用比僅依賴大型多模態模型顯著更便宜且更快的電腦自動化代理。

亮點

  • 極致的成本效率:對於多步驟任務,比使用邊界模型便宜多達 300 倍。
  • 低延遲:與全模型規劃相比,決策步驟所需時間僅為幾分之一。
  • 混合感知:結合 OCR 和輔助功能樹,以識別文字和非文字控件。
  • 螢幕外控件支援:可以與輔助功能樹中存在但當前未在螢幕上顯示的帶標籤控件進行互動。
  • 確定性狀態:將推理(如日期解析)重建為確定性程式碼,以避免依賴昂貴的模型推理。

相關

  • 專案
  • 專案
  • 專案
  • 專案