McGill-NLP/webllama
Llama-3 agents that can browse the web by following instructions and talking to you
何を解決するか
WebLlamaは、ユーザーの補助者として機能する人間中心のウェブブラウジングエージェントの構築を目指しています。実世界のウェブサイト(予約、ショッピング、知識検索など)をナビゲートするエージェントの訓練の難しさに直面しつつ、マルチターン対話でユーザーと連携する方法を提供します。
動作方法
このプロジェクトは、Llamaベースのエージェントの訓練と評価のためのフレームワークを提供します。主なモデルである Llama-3-8B-Web は、Meta-Llama-3-8B-Instruct の微調整版で、WebLINX 1.0 データセットの選別されたサブセット(24,000件以上のウェブインタラクション例:クリック、テキスト入力、対話行動など)を用いて訓練されています。
これらのエージェントをデプロイするには、BrowserGym、Playwright、Selenium などのブラウザ自動化ツールと統合されており、ウェブページの状態をテキスト表現として翻訳し、実行可能なアクションに変換できます。
対象ユーザー
実世界のウェブサイトナビゲーションに特化したAIエージェントを開発する研究者や開発者。専用モデル、訓練スクリプト、標準化されたベンチマークが必要な方々に最適です。
主な特徴
- 高いパフォーマンス:WebLINX 1.0ベンチマークにおいて、
Llama-3-8B-WebはGPT-4V(ゼロショット)を18%上回ります。 - 人間中心の設計:エージェントがユーザーと対話しながらブラウジングできるように設計されています。
- 包括的な評価:新しいウェブサイト、ドメイン、地理的場所への汎化能力をテストするためのベンチマークを含みます。
- 拡張可能なエコシステム:BrowserGymと統合されており、Streamlitアプリを用いた評価結果の可視化ツールも提供しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト