0xMassi/webclaw

Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.

무엇 을 해결하는가

웹 스크래핑 도구는 종종 봇 탐지에 의해 차단되거나 탐색, 스크립트, 광고와 같은 관련 없는 boilerplate(탐색, 스크립트, 광고)로 가득 찬 출력을 생성하는데,これが AI 에이전트와 RAG 파이프라인의 컨텍스트 윈도우를 어지럽힙니다. webclaw는 웹사이트를 Markdown이나 JSON과 같은 깨끗하고 구조화된 형식으로 변환하여 소음을 제거하고 LLM에 적합한 콘텐츠를 제공합니다.

어떻게 작동하나요

webclaw는 HTML을 간단한 형식으로 처리하는 핵심 추출 엔진을 제공합니다. 이 도구와 상호작용하는 여러 가지 방법을 제공합니다:

  • 로컬 실행: 계정 없이 기본 추출을 수행할 수 있는 CLI와 MCP 서버.
  • 호스팅 API: JavaScript 렌더링, 봇 보호 사이트, 복잡한 연구 작업을 처리하는 클라우드 서비스.
  • SDK: TypeScript, Python, Go용 라이브러리로 애플리케이션에 추출 기능을 통합할 수 있습니다.
  • MCP 서버: AI 에이전트(Claude 또는 Cursor와 같이)가 스크래핑과 크롤링을 네이티브 도구처럼 사용할 수 있게 하는 Model Context Protocol 서버.

누구를 위한 것인가

AI 에이전트, RAG(검색 증강 생성) 파이프라인을 구축하는 개발자와, 웹 페이지의 혼란스러운 내용을 LLM용 고품질 구조화된 데이터로 변환해야 하는 연구자를 대상으로 합니다.

주요 기능

  • LLM 최적화 형식: 에이전트를 위한 Markdown, JSON 및 kompakt한 llm 형식으로 특별히 설계된 출력.
  • 에이전트 통합: MCP에 대한 네이티브 지원으로, 에이전트가 페이지를 직접 스크래핑, 크롤링, 요약할 수 있게 함.
  • 크롤 및 매핑: 링크를 따라가서 전체 문서 사이트를 발견하고 추출할 수 있는 기능.
  • 로컬 우선 접근 방식: 핵심 추출 로직은 로컬에서 사용할 수 있으며, JS 렌더링과 같은 고급 요구 사항을 위해 호스팅 API도 제공됩니다.
  • 브랜드 인텔리전스: 색상, 폰트, 로고와 같은 브랜드 자산을 추출하는 특수 도구.