awlevin/typesafe-computer-use

Computer use for about $0.0002 a step: OCR the screen, classify the next action with TypeSafe, click. macOS.

解决的问题

它提供了一种经济高效且快速的方式,使用纯英语目标来自动化 Mac 电脑。与将完整截图发送给昂贵 LLM 的边界模型不同,该项目通过使用小型专用分类器进行决策,并仅在需要自由文本输入时调用写作模型,从而降低了成本和延迟。

工作原理

系统在一个循环中运行,处理屏幕并确定下一个操作:

  1. 感知:它捕获屏幕,使用 Vision OCR 读取文本,并遍历 macOS 辅助功能树以查找带标签的控件。它采用缓存系统,仅重新读取屏幕上发生变化的磁贴,以节省 OCR 成本。
  2. 决策:它将处理后的屏幕状态发送到 TypeSafe 决策模型,该模型从一组互斥选项中选择一个操作(例如,点击项目、使用浏览器或输入文本)。
  3. 操作:它通过 macOS API(Quartz、AppleScript、AXPress)执行确定性操作。
  4. 文本生成:单独的“writer”模型仅针对特定任务(如为字段编写文本或建议 URL)被调用。
  5. 最终答案:一旦达到目标或循环停止,一个更强大的模型会读取最终屏幕以提供结果。

适用人群

macOS (14+) 上的开发者和高级用户,他们希望构建或使用比仅依赖大型多模态模型显著更便宜且更快的计算机自动化代理。

亮点

  • 极致的成本效率:对于多步骤任务,比使用边界模型便宜多达 300 倍。
  • 低延迟:与全模型规划相比,决策步骤所需时间仅为几分之一。
  • 混合感知:结合 OCR 和辅助功能树,以识别文本和非文本控件。
  • 屏幕外控件支持:可以与辅助功能树中存在但当前未在屏幕上显示的带标签控件进行交互。
  • 确定性状态:将推理(如日期解析)重建为确定性代码,以避免依赖昂贵的模型推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目