simular-ai/Agent-S
Agent S: an open agentic framework that uses computers like a human
解決する課題
Agent S は、コンピュータのグラフィカルユーザーインターフェース(GUI)と人間と同様に自然かつ効果的にやり取りできる AI エージェントの作成の難しさを克服するために設計されました。Windows、macOS、Linux にまたがる自律的なコンピュータ利用のフレームワークを提供し、画面内容を解釈しアクションを実行することでエージェントが複雑なタスクを遂行できるようにします。
仕組み
システムは Agent‑Computer Interface(ACI)を使用して、エージェントの高レベルな意思決定を実行可能なコマンドに変換します。通常はデュアルモデルアーキテクチャを採用し、主生成モデル(例: GPT‑5)が高レベルの推論を行い、専門のグラウンディングモデル(例: UI‑TARS)がその意図を正確な画面座標と操作にマッピングします。さらにローカルのコーディング環境を拡張でき、エージェントは Python や Bash のコードを実行して、データ処理やシステム自動化など GUI 操作よりも効率的なタスクを実行できます。
対象者
このプロジェクトは、自律的な GUI エージェントを構築する開発者・研究者、AI で手作業のワークフローを置き換えたい自動化エンジニア、そして最先端のコンピュータ利用エージェント(CUA)に関心のある方を対象としています。
ハイライト
- 人間レベルのパフォーマンス:Agent S3 は OSWorld ベンチマークで人間レベル(72.60%)を上回りました。
- クロスプラットフォーム対応:Windows、macOS、Linux で動作します。
- ゼロショット汎化:WindowsAgentArena や AndroidWorld など、特定の訓練を受けていない新環境でも高い機能を示します。
- ハイブリッドインタラクション:GUI 操作とローカルコード実行を組み合わせ、複雑なシステムタスクに対応します。