oxylabs/ai-crawler-py
Crawl a website starting from a URL, find relevant pages, and extract data – all guided by your natural language prompt.
What it solves
정적 CSS 또는 XPath 선택자를 사용하는 맞춤형 웹 스크래퍼를 구축하고 유지보수할 필요가 사라집니다. 특정 데이터를 찾기 위해 복잡한 스크립트를 작성하는 대신, 사용자는 평범한 영어로 필요한 내용을 설명하면 도구가 해당 정보를 발견하고 추출합니다.
How it works
사용자는 시작 URL과 원하는 콘텐츠를 설명하는 자연어 프롬프트를 제공합니다. AI 에이전트가 도메인을 지능적으로 탐색하고 관련 페이지를 식별한 뒤 데이터를 추출합니다. 출력은 Markdown 또는 구조화된 JSON 형태로 제공될 수 있으며, 후자의 경우 사용자는 OpenAPI 스키마를 제공하거나 프롬프트를 통해 AI가 스키마를 자동 생성하도록 할 수 있어 데이터가 애플리케이션 요구사항에 맞도록 합니다.
Who it’s for
웹 데이터를 획득해 분석이나 자동화 파이프라인에 활용하려는 개발자와 데이터 과학자를 위해 설계되었습니다. 수동으로 스크래퍼를 개발하는 데 드는 시간을 절감할 수 있습니다.
Highlights
- Natural Language Control: 간단한 영어 프롬프트로 크롤링 에이전트를 제어하고 데이터 요구사항을 정의합니다.
- AI-Driven Discovery: 사용자의 프롬프트와 가장 일치하는 페이지를 자동으로 식별하고 우선순위를 매깁니다.
- Flexible Output: Markdown과 구조화된 JSON 형식을 모두 지원합니다.
- Automated Schema Generation: 자연어 설명으로부터 파싱 스키마를 자동으로 생성할 수 있습니다.
- Technical Versatility: 정적 페이지와 JavaScript 렌더링 페이지 모두를 처리하며, 선택적으로 지리적 위치 타깃팅도 가능합니다.