awlevin/typesafe-computer-use
Computer use for about $0.0002 a step: OCR the screen, classify the next action with TypeSafe, click. macOS.
해결하는 문제
이 프로젝트는 평범한 영어 목표어를 사용하여 Mac 컴퓨터를 자동화하는 비용 효율적이고 빠른 방법을 제공합니다. 각 단계마다 전체 스크린샷을 고가의 LLM에 전송하는 프론티어 모델과 달리, 이 프로젝트는 의사결정에 소형 전문 분류기를 사용하고 자유 텍스트 입력이 필요한 경우에만 작성 모델을 호출하여 비용과 지연 시간을 줄입니다.
작동 방식
시스템은 화면을 처리하고 다음 작업을 결정하는 루프에서 작동합니다:
- 지각: 화면을 캡처하고 Vision OCR을 사용하여 텍스트를 읽으며, macOS 접근성 트리를 탐색하여 라벨이 붙은 컨트롤을 찾습니다. OCR 비용을 절약하기 위해 화면의 변경된 타일만 다시 읽는 캐싱 시스템을 사용합니다.
- 의사결정: 처리된 화면 상태를 TypeSafe 의사결정 모델에 전송하며, 이 모델은 상호 배타적인 옵션 세트에서 작업(예: 항목 클릭, 브라우저 사용, 텍스트 입력)을 선택합니다.
- 실행: macOS API(Quartz, AppleScript, AXPress)를 통해 결정론적 작업을 실행합니다.
- 텍스트 생성: 별도의 '라이터' 모델은 필드에 텍스트를 작성하거나 URL을 제안하는 것과 같은 특정 작업에서만 호출됩니다.
- 최종 답변: 목표가 달성되거나 루프가 중단되면, 더 강력한 모델이 최종 화면을 읽어서 결과를 제공합니다.
대상 사용자
macOS(14+)에서 대형 멀티모달 모델에만 의존하는 것보다 훨씬 저렴하고 빠른 컴퓨터 자동화 에이전트를 구축하거나 사용하려는 개발자와 파워 유저.
주요 특징
- 극단적인 비용 효율성: 다단계 작업에서 프론티어 모델 사용 대비 최대 300배 저렴합니다.
- 낮은 지연 시간: 전체 모델 계획에 비해 의사결정 단계가 훨씬 짧은 시간에 완료됩니다.
- 하이브리드 지각: OCR과 접근성 트리를 결합하여 텍스트 및 비텍스트 컨트롤을 모두 식별합니다.
- 화면 밖 컨트롤 지원: 현재 화면에 표시되지 않지만 접근성 트리에 존재하는 라벨이 붙은 컨트롤과 상호작용할 수 있습니다.
- 결정론적 상태: 고가의 모델 추론에 의존하지 않도록 날짜 파싱과 같은 추론을 결정론적 코드로 재구성합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트