droidrun/mobilerun
Automate your mobile devices with natural language commands - an LLM agnostic mobile Agent 🤖
What it solves
Mobilerun は、自然言語コマンドで Android と iOS デバイスを制御する方法を提供します。モバイルインタラクションの手動スクリプト作成が不要になり、LLM エージェントがアプリをナビゲートし、マルチステップのワークフローを実行し、モバイルインターフェースからデータを抽出できます。
How it works
このフレームワークは、デバイスにインストールされた「Portal」アプリを使用して、LLM とモバイル OS の間の橋渡しを行います。アクセシビリティツリー(UI 状態)とスクリーンショットを組み合わせて視覚的理解を行い、エージェントはタップ、スワイプ、入力が可能です。ユーザーは CLI、Python API、または Docker を通じてシステムと対話でき、OpenAI、Anthropic、Gemini などのさまざまな LLM プロバイダーを選択できます。複雑なタスク向けに「推論モード」を備えており、マネージャ‑エグゼキュータの計画アーキテクチャを採用しています。
Who it’s for
- QA Engineers: モバイルアプリのテストとリグレッションチェックに。
- Developers: Python でカスタムモバイル自動化ワークフローを構築するために。
- Automation Enthusiasts: 繰り返しのモバイルタスクを自動化したり、ネイティブアプリからデータを抽出したりするために。
- Non-technical Users: シンプルなプロンプトでガイドされたモバイルワークフローを実行できるように。
Highlights
- Cross-Platform: Android と iOS の両方のデバイスをサポート。
- Multimodal Input: アクセシビリティツリーとビジョンベースのスクリーンショット解析を組み合わせ。
- Flexible Execution: 簡単なタスク向けに CLI、深い統合向けに Python API を提供。
- Reasoning Mode: 複雑でマルチステップの計画を可能にし、高度な自動化を実現。
- Broad Model Support: OpenAI、Anthropic、Gemini、Ollama、DeepSeek、OpenRouter と互換性あり。