simular-ai/Agent-S
Agent S: an open agentic framework that uses computers like a human
解決する課題
Agent S は、AIエージェントが人間と同じようにコンピュータのグラフィカルユーザーインターフェース(GUI)を操作する方法を提供します。エージェントが画面を認識し、さまざまなデスクトップおよびWebアプリケーション間でマウス、キーボード、スクロールアクションを使用して操作できるようにすることで、カスタムAPI統合やアプリごとのスクリプト作成の必要性を排除します。
仕組み
このフレームワークは、メイン生成モデル(GPT-5など)と特化したグラウンディングモデル(UI-TARSなど)を組み合わせて、自然言語の指示を実行可能なGUIアクションに変換します。画面のスクリーンショットをキャプチャして分析し、タスクを完了するために必要なクリックやキーストロークを決定します。また、データ処理やシステム自動化を伴うタスクのためにPythonおよびBashコードを実行するローカルコーディング環境で構成することもできます。
対象者
このプロジェクトは、OSエージェントを研究する研究者、自身のデスクトップワークフローを自動化したい開発者、およびオープンソースのコンピュータ使用AIの貢献者向けに設計されています。
ハイライト
- クロスプラットフォームサポート: macOS、Windows、Linuxで動作します。
- 人間レベルのパフォーマンス: Agent S3は、OSWorldベンチマークで人間のパフォーマンスを初めて超えたコンピュータ使用エージェントです (72.60%)。
- モデルの柔軟性: vLLMまたはOpen Routerを介して、OpenAI、Anthropic、Gemini、およびオープンウェイトプロバイダーのモデルと互換性があります。
- 統合コーディング環境: 複雑なシステムタスクのために、ローカルで任意のPythonおよびBashコードを実行できるオプション機能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト