awlevin/typesafe-computer-use

Computer use for about $0.0002 a step: OCR the screen, classify the next action with TypeSafe, click. macOS.

解決する課題

このプロジェクトは、プレーンな英語の目標を使用してMacコンピュータを自動化するための、コスト効率が高く高速な方法を提供します。各ステップでフルスクリーンショットを高価なLLMに送信するフロンティアモデルとは異なり、このプロジェクトは意思決定に小型の専門分類器を使用し、フリーテキストの入力が必要な場合のみ書き込みモデルを呼び出すことで、コストとレイテンシを削減します。

動作原理

システムは画面を処理し、次のアクションを決定するループで動作します:

  1. 知覚: 画面をキャプチャし、Vision OCRを使用してテキストを読み取り、macOSのアクセシビリティツリーを巡回してラベル付きコントロールを探します。OCRコストを節約するために、画面の変更されたタイルのみを再読み込みするキャッシュシステムを採用しています。
  2. 意思決定: 処理された画面状態をTypeSafe決定モデルに送信し、互いに排他的なオプションのセットからアクション(例:アイテムのクリック、ブラウザの使用、テキストの入力)を選択します。
  3. アクション: macOS API(Quartz、AppleScript、AXPress)を通じて決定論的なアクションを実行します。
  4. テキスト生成: 別の「ライター」モデルは、フィールドへのテキスト作成やURLの提案などの特定のタスクでのみ呼び出されます。
  5. 最終回答: 目標が達成されたりループが停止したりすると、より強力なモデルが最終画面を読み取り、結果を提供します。

対象ユーザー

macOS (14+) で、大型マルチモーダルモデルにのみ依存するものよりもはるかに安価で高速なコンピュータ自動化エージェントを構築または使用したい開発者やパワーユーザー。

ハイライト

  • 極端なコスト効率: マルチステップタスクにおいて、フロンティアモデルの使用と比較して最大300倍安価。
  • 低レイテンシ: フルモデルのプランニングと比較して、意思決定ステップはわずかな時間で完了します。
  • ハイブリッド知覚: OCRとアクセシビリティツリーを組み合わせ、テキストおよび非テキストの両方のコントロールを識別します。
  • オフスクリーンコントロールのサポート: アクセシビリティツリーに存在するが、現在画面に表示されていないラベル付きコントロールとインタラクションできます。
  • 決定論的な状態: 高価なモデルの推論に依存することを避けるため、日付パースなどの推論を決定論的なコードとして再構築します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト