unclecode/crawl4ai

🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN

해결하는 문제

Crawl4AI는 대규모 언어 모델(LLM)을 위한 웹 콘텐츠를 준비하기 위해 특별히 설계된 오픈소스 웹 크롤러 및 스크래퍼입니다. 노이즈가 많고 비구조적인 웹 데이터의 문제를 해결하며, RAG(Retrieval-Augmented Generation), AI 에이전트, 데이터 파이프라인에 최적화된 깨끗하고 구조화된 마크다운으로 페이지를 변환합니다.

작동 방식

이 도구는 Playwright를 통해 비동기 브라우저 풀을 사용하여 웹 페이지를 가져오고 다양한 처리 전략을 적용합니다:

  • 마크다운 생성: BM25 알고리즘과 같은 히ュ리스틱 기반 필터링을 사용하여 노이즈를 제거하고 핵심 정보에 집중하는 '적합한 마크다운'을 생성합니다.
  • 구조화된 추출: 복잡한 데이터에 대해 LLM 기반 추출을 지원하며, 빠르고 스키마가 정의된 JSON 출력을 위한 CSS/XPath 기반 추출도 가능합니다.
  • 브라우저 제어: 브라우저 세션, 프록시, 쿠키를 관리하고, 동적 콘텐츠나 무한 스크롤을 처리하기 위해 사용자 정의 자바스크립트를 실행할 수 있습니다.
  • 배포: Python 라이브러리, CLI, 또는 모니터링 대시보드가 있는 Docker화된 FastAPI 서버로 실행할 수 있습니다.

대상 사용자

  • AI 개발자: 고품질이고 깨끗한 웹 데이터를 입력으로 필요로 하는 RAG 시스템 또는 AI 에이전트를 구축하는 사람.
  • 데이터 엔지니어: 봇 탐지에 걸리지 않고, 확장 가능하고 제어 가능한 방법으로 웹에서 구조화된 데이터를 추출하고자 하는 사용자.
  • LLM 애플리케이션 개발자: 프로퍼라이어터리 스크래핑 API의 요금을 지불하지 않고도 웹을 기계가 읽을 수 있는 형식으로 변환하고자 하는 개발자.

주요 특징

  • LLM 대응 출력: 제목, 표, 인용 참고 정보를 포함한 구조화된 마크다운을 생성합니다.
  • 스텔스 모드: 실제 사용자를 모방하여 봇 탐지 회피.
  • 적응형 지능: 사이트 패턴을 학습하여 관련 콘텐츠만 탐색합니다.
  • 심층 크롤링: 충돌 복구 및 프리페치 모드를 지원하는 BFS 전략을 통해 더 빠른 탐색을 가능하게 합니다.
  • 유연한 추출: LLM 기반 의미적 추출과 빠른 CSS 기반 스키마 추출을 결합할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트