web-infra-dev/midscene-skills

AI-powered, vision-driven UI automation for every platform.

解决的问题

Midscene Skills 提供了一种使用自然语言跨不同平台自动化 UI 交互的方法。它消除了编写复杂且脆弱的 same-element same-element same-element 脚本的需求,让 AI 能够“看见”并与屏幕交互,而不受平台限制。

运作方式

该项目构建于 Midscene.js 之上,使用基于视觉的自动化。它不依赖应用程序的底层代码,而是完全通过截图进行操作。它需要具备强大视觉定位能力的模型,才能根据自然语言指令准确定位屏幕上的 UI 元素。

适用对象

需要跨网页浏览器、桌面操作系统 (macOS, Windows, Linux) 和移动设备 (Android, iOS, HarmonyOS) 自动化任务的开发者和 QA 工程师,以及将 AI 代理整合到工作流程中的人员。

亮点

  • 跨平台支持:跨浏览器、Chrome Bridge、桌面、Android、iOS 和 HarmonyOS 运行。
  • 视觉驱动:通过截图操作,使其在跨平台使用上更加可靠。
  • 自然语言控制:允许用户使用纯英文指令与 UI 元素交互。
  • E2E 测试:包含通过 Vitest 管理 AI 驱动的端到端测试的脚手架。

相关

  • 项目
  • 项目
  • 项目
  • 项目