web-infra-dev/midscene-skills
AI-powered, vision-driven UI automation for every platform.
解决的问题
Midscene Skills 提供了一种使用自然语言跨不同平台自动化 UI 交互的方法。它消除了编写复杂且脆弱的 same-element same-element same-element 脚本的需求,让 AI 能够“看见”并与屏幕交互,而不受平台限制。
运作方式
该项目构建于 Midscene.js 之上,使用基于视觉的自动化。它不依赖应用程序的底层代码,而是完全通过截图进行操作。它需要具备强大视觉定位能力的模型,才能根据自然语言指令准确定位屏幕上的 UI 元素。
适用对象
需要跨网页浏览器、桌面操作系统 (macOS, Windows, Linux) 和移动设备 (Android, iOS, HarmonyOS) 自动化任务的开发者和 QA 工程师,以及将 AI 代理整合到工作流程中的人员。
亮点
- 跨平台支持:跨浏览器、Chrome Bridge、桌面、Android、iOS 和 HarmonyOS 运行。
- 视觉驱动:通过截图操作,使其在跨平台使用上更加可靠。
- 自然语言控制:允许用户使用纯英文指令与 UI 元素交互。
- E2E 测试:包含通过 Vitest 管理 AI 驱动的端到端测试的脚手架。
相关
- 项目
- 项目
- 项目
- 项目