0xMassi/webclaw

Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.

What it solves

웹 스크레이핑 도구는 종종 봇 보호에 의해 차단되거나 원시 HTML, 탐색 메뉴, 스크립트 및 광고로 뒤섞인 출력을 생성합니다. webclaw은 웹사이트를 깨끗하고 구조화된 콘텐츠(Markdown, JSON 또는 LLM 최적화 텍스트)로 변환하여 AI 에이전트와 RAG 파이프라인에서 즉시 사용할 수 있도록 함으로써 이 문제를 해결합니다.

How it works

webclaw은 불필요한 요소를 제거하고 구조를 유지하는 추출 엔진을 제공합니다. CLI 도구, Claude 및 Cursor와 같은 AI 에이전트를 위한 MCP (Model Context Protocol) 서버, 또는 SDK 및 REST API를 통해 사용할 수 있습니다. 핵심 경로에 대한 로컬 추출을 지원하며, JavaScript 렌더링 및 봇 보호 우회와 같은 고급 요구 사항을 위해 호스팅 API를 제공합니다.

Who it's for

URL 또는 전체 문서 사이트에서 노이즈 없는 고품질 웹 데이터 추출이 필요한 AI 에이전트, RAG (Retrieval-Augmented Generation) 시스템 및 자동화 워크플로우를 구축하는 개발자용입니다.

Highlights

  • Multiple Output Formats: Markdown, LLM 최적화 텍스트, JSON 및 일반 텍스트를 지원합니다.
  • Crawl and Map: 링크를 따라 사이트 전체를 크롤링하거나 전체 추출 없이 URL을 매핑할 수 있는 기능.
  • MCP Integration: MCP 서버를 통한 AI 에이전트 네이티브 지원으로 에이전트가 페이지를 직접 스크레이핑, 크롤링 및 요약할 수 있습니다.
  • Local-First Approach: 핵심 추출은 API 키 없이 로컬에서 작동하며, 복잡한 사이트를 위한 호스팅 옵션이 제공됩니다.
  • Brand Intelligence: 색상, 글꼴, 로고와 같은 브랜드 자산을 추출하기 위한 전문 도구.
  • Broad Integration: TypeScript, Python 및 Go용 SDK를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트