web-infra-dev/midscene-skills
AI-powered, vision-driven UI automation for every platform.
해결하는 문제
Midscene Skills는 자연어를 사용하여 다양한 플랫폼에서 UI 상호작용을 자동화하는 방법을 제공합니다. AI가 플랫폼에 관계없이 화면을 "보고" 상호작용할 수 있도록 함으로써 복잡하고 취약한 same-element same-element same-element 스크립트를 작성할 필요를 없앱니다.
작동 방식
이 프로젝트는 비전 기반 자동화를 사용하는 Midscene.js 위에 구축되었습니다. 애플리케이션의 기본 코드에 의존하는 대신 스크린샷을 통해 완전히 작동합니다. 자연어 지침을 기반으로 화면의 UI 요소를 정확하게 찾으려면 강력한 시각적 그라운딩 기능을 갖춘 모델이 필요합니다.
대상
웹 브라우저, 데스크톱 OS(macOS, Windows, Linux) 및 모바일 기기(Android, iOS, HarmonyOS) 전반에 걸쳐 작업을 자동화해야 하는 개발자 및 QA 엔지니어, 그리고 워크플로우에 AI 에이전트를 통합하는 사람들.
주요 기능
- 크로스 플랫폼 지원: Browser, Chrome Bridge, Desktop, Android, iOS, HarmonyOS에서 작동합니다.
- 비전 기반: 스크린샷을 통해 작동하여 크로스 플랫폼 사용 시 더욱 안정적으로 만듭니다.
- 자연어 제어: 일반 영어 지침을 사용하여 UI 요소와 상호작용할 수 있습니다.
- E2E 테스트: Vitest를 통해 AI 기반 엔드투엔드 테스트를 관리하기 위한 스캐폴드가 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트