oxylabs/ai-crawler-py

Crawl a website starting from a URL, find relevant pages, and extract data – all guided by your natural language prompt.

What it solves

它消除了需要建立與維護使用靜態 CSS 或 XPath 選擇器的自訂網路爬蟲的需求。使用者不必編寫複雜的腳本來在網站上尋找特定資料,只要用簡單的英文描述需求,工具就會負責發現與抽取該資訊。

How it works

使用者提供起始 URL 與描述所需內容的自然語言提示。AI 代理人會智慧地探索整個網域,找出相關頁面並抽取資料。輸出可以是 Markdown 或結構化的 JSON;若選擇 JSON,使用者可以提供 OpenAPI schema,或讓 AI 從提示自動產生 schema,以確保資料符合應用程式的需求。

Who it’s for

此工具設計給需要取得網站資料以進行分析或自動化流程的開發者與資料科學家,讓他們不必花時間手動開發爬蟲。

Highlights

  • Natural Language Control: 使用簡單的英文提示來指導爬蟲代理人並定義資料需求。
  • AI-Driven Discovery: 自動辨識並優先處理最符合使用者提示的頁面。
  • Flexible Output: 支援 Markdown 與結構化 JSON 兩種格式。
  • Automated Schema Generation: 能從自然語言描述自動產生解析 schema。
  • Technical Versatility: 可處理靜態頁面與 JavaScript 渲染頁面,並支援可選的地理位置定位。