alirezamika/autoscraper

A Smart, Automatic, Fast and Lightweight Web Scraper for Python

해결하는 문제

AutoScraper는 복잡한 CSS 선택자나 XPath 표현식을 수동으로 작성할 필요 없이 웹 스크래핑을 간소화합니다. 각 웹사이트에 규칙을 하드코딩하는 대신, 원하는 데이터의 몇 가지 예시를 제공하기만 하면 도구가 동일하거나 다른 페이지에서 유사한 요소를 찾기 위한 패턴을 자동으로 학습합니다.

작동 방식

이 도구는 URL 또는 HTML 콘텐츠와 "원하는" 샘플 데이터 목록(예: 텍스트, URL, HTML 태그 값 등)을 입력받습니다. 페이지 구조를 분석하여 이러한 샘플을 기반으로 스크래핑 규칙을 학습합니다. 모델이 생성되면, 동일한 패턴에 맞는 요소 목록(유사 결과) 또는 제공된 샘플과 동일한 순서의 특정 요소(정확한 결과)를 검색하는 데 사용할 수 있습니다.

대상 사용자

HTML 구조를 분석하거나 취약한 선택자 유지에 시간을 들이지 않고 빠르게 웹사이트에서 데이터를 추출해야 하는 Python 개발자.

주요 특징

  • 예시 기반 학습: 샘플 데이터 목록에서 스크래핑 규칙을 자동으로 학습.
  • 유연한 추출: 모든 게시물 제목과 같은 유사 요소나 특정 주식 가격과 같은 특정 요소를 모두 지원.
  • 모델 지속성: 학습된 스크래핑 규칙을 파일에 저장하고 다시 불러와 재사용 가능.
  • 사용자 정의 요청: requests 모듈을 통해 사용자 정의 헤더 및 프록시를 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트