McGill-NLP/webllama

Llama-3 agents that can browse the web by following instructions and talking to you

何を解決するか

WebLlamaは、ユーザーの補助者として機能する人間中心のウェブブラウジングエージェントの構築を目指しています。実世界のウェブサイト(予約、ショッピング、知識検索など)をナビゲートするエージェントの訓練の難しさに直面しつつ、マルチターン対話でユーザーと連携する方法を提供します。

動作方法

このプロジェクトは、Llamaベースのエージェントの訓練と評価のためのフレームワークを提供します。主なモデルである Llama-3-8B-Web は、Meta-Llama-3-8B-Instruct の微調整版で、WebLINX 1.0 データセットの選別されたサブセット(24,000件以上のウェブインタラクション例:クリック、テキスト入力、対話行動など)を用いて訓練されています。

これらのエージェントをデプロイするには、BrowserGym、Playwright、Selenium などのブラウザ自動化ツールと統合されており、ウェブページの状態をテキスト表現として翻訳し、実行可能なアクションに変換できます。

対象ユーザー

実世界のウェブサイトナビゲーションに特化したAIエージェントを開発する研究者や開発者。専用モデル、訓練スクリプト、標準化されたベンチマークが必要な方々に最適です。

主な特徴

  • 高いパフォーマンス:WebLINX 1.0ベンチマークにおいて、Llama-3-8B-Web はGPT-4V(ゼロショット)を18%上回ります。
  • 人間中心の設計:エージェントがユーザーと対話しながらブラウジングできるように設計されています。
  • 包括的な評価:新しいウェブサイト、ドメイン、地理的場所への汎化能力をテストするためのベンチマークを含みます。
  • 拡張可能なエコシステム:BrowserGymと統合されており、Streamlitアプリを用いた評価結果の可視化ツールも提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト