rdi-berkeley/agents-last-exam

Agents' Last Exam

何を解決するか

エージェントの最終試験(ALE)は、長期にわたる、経済的に価値のある現実世界の専門的タスクにおけるエージェントのパフォーマンスを測定できる、広範囲にわたるベンチマークの欠如に対処します。単純なプロンプトを越えて、エージェントが多様な業界分野で複雑な作業を実際に完了できるかどうか、検証可能な結果で評価します。

仕組み

ALEは、テスト対象のシステム(エージェントハーネス)と現実的な環境(WindowsまたはLinuxのサンドボックス)および特定の専門的タスクを組み合わせるオープンな評価フレームワークを提供します。

主な構成要素は以下の通りです:

  • CUA-agents:CLI(コマンドラインインターフェース)とGUI(グラフィカルユーザーインターフェース)の両方の機能を組み合わせたエージェントを評価します。クロスOSのCUA MCPブリッジを使用して、クリックや入力などのデスクトップ操作をエージェントのツールとして公開します。
  • サンドボックス:プロダクション環境を再現する実際のマシン(VMまたはコンテナ)上でタスクを実行し、専門的なソフトウェアやデータを含みます。
  • 決定論的評価:各タスクには、エージェントの作業終了後にスコアを0〜1の範囲で評価するための隠し参照が存在します。
  • 実行ループ:システムはサンドボックスをプロビジョニングし、入力をステージングし、エージェントを実行して完了させ、隠し参照をステージングし、結果を評価します。

対象ユーザー

ALEは、前線のエージェントシステムの開発者や、リアルなオペレーティングシステム環境でマルチステップの専門的ワークフローを実行できるかどうかをベンチマークする必要がある研究者向けに設計されています。

特徴

  • 広範なカバレッジ:米国連邦職業分類に基づき、13の業界クラスターにまたがる55のサブドメインをカバーします。
  • 検証可能な結果:隠し参照と決定論的評価者を使用して漏洩を防ぎ、客観的なスコアリングを保証します。
  • マルチプラットフォーム対応:Google Cloud、AWS、Alibaba Cloud、QEMU/KVM、Dockerを介したサンドボックスをサポートします。
  • 完全な監査:すべての実行で一貫したトラジェクトリ、ローグ、アーティファクトを記録し、エンドツーエンドの再実行を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト