McGill-NLP/webllama

Llama-3 agents that can browse the web by following instructions and talking to you

해결하는 문제

WebLlama는 사용자 대신이 아니라 보조자로서 작동하는 인간 중심의 웹 브라우징 에이전트를 만드는 것을 목표로 합니다. 예약, 쇼핑, 지식 검색 등 실제 웹사이트를 탐색하는 데 있어 에이전트를 훈련시키는 어려움을 해결하며, 다중 대화 루프를 통해 사용자와 상호작용합니다.

작동 방식

이 프로젝트는 Llama 기반 에이전트의 훈련 및 평가를 위한 프레임워크를 제공합니다. 주요 모델인 Llama-3-8B-Web는 Meta-Llama-3-8B-Instruct의 미세조정된 버전으로, 24,000개 이상의 웹 상호작용(클릭, 텍스트 입력, 대화 행동 등)을 포함하는 WebLINX 1.0 데이터셋의 정제된 하위 집합을 기반으로 훈련되었습니다.

이러한 에이전트를 배포하기 위해 BrowserGym, Playwright, Selenium과 같은 브라우저 자동화 도구와 통합되어, 웹 페이지 상태의 텍스트 표현을 실행 가능한 동작으로 변환할 수 있습니다.

대상 사용자

실제 웹사이트 탐색을 위한 특화된 모델, 훈련 스크립트, 표준화된 벤치마크가 필요한 웹 탐색 AI 에이전트를 개발하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 높은 성능: WebLINX 1.0 벤치마크에서 Llama-3-8B-Web는 GPT-4V(제로샷)보다 18% 높은 성능을 기록합니다.
  • 사용자 중심 설계: 에이전트가 사용자와 대화를 통해 탐색할 수 있도록 설계되었습니다.
  • 포괄적인 평가: 새로운 웹사이트, 도메인, 지리적 위치에 대한 일반화 능력을 테스트할 수 있는 벤치마크를 포함합니다.
  • 확장 가능한 생태계: BrowserGym과 통합되어 있으며, Streamlit 앱을 통해 평가 결과를 시각화할 수 있는 도구도 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트