oxylabs/ai-crawler-py

Crawl a website starting from a URL, find relevant pages, and extract data – all guided by your natural language prompt.

What it solves

静的な CSS や XPath セレクタを使用したカスタムウェブスクレイパーを構築・保守する必要がなくなります。特定のデータを取得するために複雑なスクリプトを書く代わりに、ユーザーは英語で必要な情報を記述するだけで、ツールがその情報の発見と抽出を行います。

How it works

ユーザーは開始 URL と、取得したいコンテンツを説明する自然言語プロンプトを提供します。AI エージェントがドメインをインテリジェントに探索し、関連ページを特定してデータを抽出します。出力は Markdown または構造化 JSON のいずれかで提供でき、後者の場合は OpenAPI スキーマを提供するか、プロンプトから AI に生成させて、データがアプリケーションの要件に合致するようにします。

Who it’s for

ウェブデータを取得して分析や自動化パイプラインに利用したい開発者やデータサイエンティスト向けに設計されています。手動でスクレイパーを作成する時間を削減できます。

Highlights

  • Natural Language Control: プレーンな英語のプロンプトでクローラーエージェントを操作し、データ要件を定義します。
  • AI-Driven Discovery: ユーザーのプロンプトに最も合致するページを自動的に識別・優先順位付けします。
  • Flexible Output: Markdown と構造化 JSON の両方をサポートします。
  • Automated Schema Generation: 自然言語の説明から自動的にパーススキーマを生成できます。
  • Technical Versatility: 静的ページと JavaScript レンダリングページの両方に対応し、オプションでジオロケーションターゲティングも可能です。