webclaw: 웹사이트를 깨끗한 마크다운과 AI 에이전트를 위한 구조화된 데이터로 변환하는 웹 추출 엔진
webclaw: 웹사이트를 깨끗한 마크다운과 AI 에이전트를 위한 구조화된 데이터로 변환하는 웹 추출 엔진
What it solves
웹 스크래핑 도구는 종종 봇 탐지에 의해 차단되거나 관련 없는 boilerplate(네비게이션, 스크립트, 광고)로 가득 찬 출력을 만들어내며, 이는 AI 에이전트와 RAG 파이프라인의 컨텍스트 윈도우를 어지럽힙니다. webclaw는 웹사이트를 마크다운이나 JSON과 같은 깨끗하고 구조화된 형식으로 변환하여 소음을 제거하고 LLM이 바로 사용할 수 있는 콘텐츠를 제공합니다.
How it works
webclaw는 HTML을 간단한 형식으로 처리하는 핵심 추출 엔진을 제공합니다. 다음과 같은 여러 가지 방법으로 도구와 상호작용할 수 있습니다:
- Local Execution: 계정 없이 기본 추출을 수행하는 CLI와 MCP 서버.
- Hosted API: JavaScript 렌더링, 봇 보호 사이트, 복잡한 연구 작업을 처리하는 클라우드 서비스.
- SDKs: 애플리케이션에 추출을 통합하기 위한 TypeScript, Python, Go 라이브러리.
- MCP Server: AI 에이전트(예: Claude 또는 Cursor)가 스크래핑과 크롤링을 네이티브 도구처럼 사용할 수 있게 하는 Model Context Protocol 서버.
Who it’s for
AI 에이전트, RAG(Retrieval-Augmented Generation) 파이프라인, 그리고 웹 페이지의 혼란스러운 내용을 LLM용 고품질 구조화된 데이터로 변환해야 하는 연구자를 위한 개발자.
Highlights
- LLM-Optimized Formats: 마크다운, JSON, 그리고 에이전트를 위한 컴팩트한
llm형식으로 특별히 설계된 출력. - Agent Integration: MCP 네이티브 지원으로, 에이전트가 페이지를 직접 스크래핑, 크롤링, 요약할 수 있게 함.
- Crawl and Map: 링크를 따라가서 전체 문서 사이트를 발견하고 추출할 수 있는 기능.
- Local-First Approach: 핵심 추출 로직은 로컬에서 사용할 수 있으며, JS 렌더링과 같은 고급 요구사항을 위해 호스팅 API 제공.
- Brand Intelligence: 색상, 폰트, 로고와 같은 브랜드 자산을 추출하는 특수 도구.
Sources
- Repo0xMassi/webclaw