oxylabs/ai-crawler-py

Crawl a website starting from a URL, find relevant pages, and extract data – all guided by your natural language prompt.

What it solves

它消除了需要构建和维护使用静态 CSS 或 XPath 选择器的自定义网页爬虫的需求。用户不必编写复杂的脚本来在网站上查找特定数据,只要用简单的英文描述需求,工具就会负责发现与提取该信息。

How it works

用户提供起始 URL 与描述所需内容的自然语言提示。AI 代理人会智能地探索整个域名,识别相关页面并提取数据。输出可以是 Markdown 或结构化的 JSON;若选择 JSON,用户可以提供 OpenAPI schema,或让 AI 从提示自动生成 schema,以确保数据符合应用的需求。

Who it’s for

此工具面向需要获取网页数据进行分析或自动化流水线的开发者和数据科学家,让他们无需花时间手动开发爬虫。

Highlights

  • Natural Language Control: 使用简洁的英文提示来指导爬虫代理并定义数据需求。
  • AI-Driven Discovery: 自动识别并优先处理最符合用户提示的页面。
  • Flexible Output: 支持 Markdown 与结构化 JSON 两种格式。
  • Automated Schema Generation: 能从自然语言描述自动生成解析 schema。
  • Technical Versatility: 能处理静态页面和 JavaScript 渲染页面,并支持可选的地理位置定位。