web-infra-dev/midscene-skills

AI-powered, vision-driven UI automation for every platform.

解決する課題

Midscene Skills は、自然言語を使用して異なるプラットフォーム間でUIインタラクションを自動化する方法を提供します。AI がプラットフォームに関係なく画面を「見て」インタラクションできるようにすることで、複雑で脆弱な same-element same-element same-element スクリプトを記述する必要がなくなります。

仕組み

このプロジェクトは、ビジョンベースの自動化を使用する Midscene.js 上に構築されています。アプリケーションの基盤となるコードに依存する代わりに、スクリーンショットから完全に動作します。自然言語の指示に基づいて画面上のUI要素を正確に特定するには、強力な視覚的グラウンディング機能を持つモデルが必要です。

対象者

Web ブラウザ、デスクトップ OS (macOS, Windows, Linux)、モバイルデバイス (Android, iOS, HarmonyOS) 間でタスクを自動化する必要がある開発者や QA エンジニア、およびワークフローに AI エージェントを統合する人々。

ハイライト

  • クロスプラットフォームサポート: Browser、Chrome Bridge、Desktop、Android、iOS、HarmonyOS 間で動作します。
  • ビジョン駆動: スクリーンショットを介して操作し、クロスプラットフォームでの使用をより信頼性の高いものにします。
  • 自然言語制御: 平易な英語の指示を使用してUI要素を操作できます。
  • E2E テスト: Vitest を介して AI 駆動のエンドツーエンドテストを管理するためのスキャフォールドが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト