McGill-NLP/webllama
Llama-3 agents that can browse the web by following instructions and talking to you
解决的问题
WebLlama 的目标是创建以人类为中心的网页浏览代理,作为用户的助手而非替代者。它解决了在真实网站(如预订、购物和知识查询)中训练代理导航的困难,同时通过多轮对话与用户互动。
工作原理
该项目提供了一个用于训练和评估基于 Llama 的代理的框架。其主要模型 Llama-3-8B-Web 是 Meta-Llama-3-8B-Instruct 的微调版本,基于 WebLINX 1.0 数据集的精选子集进行训练,该子集包含超过 24,000 个网页交互实例(如点击、文本输入和对话行为)。
为了部署这些代理,项目集成了 BrowserGym、Playwright 和 Selenium 等浏览器自动化工具,使模型能够将网页状态的文本表示转换为可执行操作。
适用人群
需要专用模型、训练脚本和标准化基准来应对真实网站导航的研究人员和开发者。
主要亮点
- 高性能:在 WebLINX 1.0 基准测试中,
Llama-3-8B-Web的表现比 GPT-4V(零样本)高出 18%。 - 以人为本的设计:专注于对话引导的浏览,代理可以与用户进行交流。
- 全面的评估:包含用于测试在新网站、新域名和新地理区域泛化能力的基准。
- 可扩展的生态系统:与 BrowserGym 集成,并提供通过 Streamlit 应用程序可视化评估结果的工具。
相关
- 项目
- 项目
- 项目
- 项目
- 项目