web-infra-dev/midscene-skills
AI-powered, vision-driven UI automation for every platform.
解決する課題
Midscene Skills は、自然言語を使用して異なるプラットフォーム間でUIインタラクションを自動化する方法を提供します。AI がプラットフォームに関係なく画面を「見て」インタラクションできるようにすることで、複雑で脆弱な same-element same-element same-element スクリプトを記述する必要がなくなります。
仕組み
このプロジェクトは、ビジョンベースの自動化を使用する Midscene.js 上に構築されています。アプリケーションの基盤となるコードに依存する代わりに、スクリーンショットから完全に動作します。自然言語の指示に基づいて画面上のUI要素を正確に特定するには、強力な視覚的グラウンディング機能を持つモデルが必要です。
対象者
Web ブラウザ、デスクトップ OS (macOS, Windows, Linux)、モバイルデバイス (Android, iOS, HarmonyOS) 間でタスクを自動化する必要がある開発者や QA エンジニア、およびワークフローに AI エージェントを統合する人々。
ハイライト
- クロスプラットフォームサポート: Browser、Chrome Bridge、Desktop、Android、iOS、HarmonyOS 間で動作します。
- ビジョン駆動: スクリーンショットを介して操作し、クロスプラットフォームでの使用をより信頼性の高いものにします。
- 自然言語制御: 平易な英語の指示を使用してUI要素を操作できます。
- E2E テスト: Vitest を介して AI 駆動のエンドツーエンドテストを管理するためのスキャフォールドが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト