web-infra-dev/midscene-skills

AI-powered, vision-driven UI automation for every platform.

解決的問題

Midscene Skills 提供了一種使用自然語言跨不同平台自動化 UI 互動的方法。它消除了編寫複雜且脆弱的 same-element same-element same-element 腳本的需求,讓 AI 能夠「看見」並與螢幕互動,而不受平台限制。

運作方式

該專案建構於 Midscene.js 之上,使用視覺基礎的自動化。它不依賴應用程式的底層程式碼,而是完全透過螢幕截圖進行操作。它需要具備強大視覺定位能力的模型,才能根據自然語言指令準確定位螢幕上的 UI 元素。

適用對象

需要跨網頁瀏覽器、桌面作業系統 (macOS, Windows, Linux) 和行動裝置 (Android, iOS, HarmonyOS) 自動化任務的開發者和 QA 工程師,以及將 AI 代理整合到工作流程中的人員。

亮點

  • 跨平台支援:跨瀏覽器、Chrome Bridge、桌面、Android、iOS 和 HarmonyOS 運作。
  • 視覺驅動:透過螢幕截圖操作,使其在跨平台使用上更加可靠。
  • 自然語言控制:允許使用者使用純英文指令與 UI 元素互動。
  • E2E 測試:包含透過 Vitest 管理 AI 驅動的端對端測試的框架。

相關

  • 專案
  • 專案
  • 專案
  • 專案