McGill-NLP/webllama
Llama-3 agents that can browse the web by following instructions and talking to you
解決的問題
WebLlama 的目標是建立以人類為中心的網頁瀏覽代理,作為使用者的助手而非替代者。它解決了在真實網站(如預訂、購物和知識查詢)中訓練代理導航的困難,同時透過多輪對話與使用者互動。
工作原理
本專案提供一個用於訓練與評估基於 Llama 的代理的框架。其主要模型 Llama-3-8B-Web 是 Meta-Llama-3-8B-Instruct 的微調版本,基於 WebLINX 1.0 數據集的精選子集進行訓練,該子集包含超過 24,000 個網頁互動實例(如點擊、文字輸入和對話行為)。
為了部署這些代理,專案整合了 BrowserGym、Playwright 和 Selenium 等瀏覽器自動化工具,使模型能夠將網頁狀態的文本表示轉換為可執行動作。
適用對象
需要專用模型、訓練腳本和標準化基準來應對真實網站導航的研究人員與開發者。
主要亮點
- 高性能量:在 WebLINX 1.0 基準測試中,
Llama-3-8B-Web的表現比 GPT-4V(零樣本)高出 18%。 - 以人為本的設計:專注於對話引導的瀏覽,代理可與使用者進行交流。
- 全面的評估:包含用於測試在新網站、新網域和新地理區域泛化能力的基準。
- 可擴展的生態系統:與 BrowserGym 整合,並提供透過 Streamlit 應用程式可視化評估結果的工具。
相關
- 專案
- 專案
- 專案
- 專案
- 專案