coder-hxl/x-crawl

Flexible Node.js AI-assisted crawler library

何を解決するか

従来のウェブクローラーは、ウェブサイトのHTML構造やクラス名が更新されると頻繁に破綻します。これは、固定されたセレクタに依存してデータを検出するためです。x-crawlはAIを統合し、ページの意味的意味を理解することで、下位のコードが変更されても正確に情報を抽出できるようにします。

動作方法

このライブラリは標準のNode.jsクローラーとAI統合(OpenAIおよびOllama経由)を組み合わせています。静的ページおよび動的ページのクロールが可能で、インターフェースデータの処理やファイルのダウンロードもサポートしています。AIを使用する場合、開発者は自然言語の指示(例:"画像リンクを取得し、重複を削除する")とともにHTMLコンテンツをAIに渡すことで、ハードコードされたCSSセレクタなしに特定の要素を解析・抽出できます。

対象ユーザー

ウェブサイトの変更に適応できる堅牢なウェブスクレイピングツールが必要な開発者、およびLLMを活用して複雑なブラウザ操作とデータ抽出を自動化したい開発者。

特徴

  • AI駆動のパース: LLMを使用して意味情報をパースし、手動でのセレクタ更新の必要性を低減。
  • 動的ページ対応: 動的ページでの自動操作、キーボード入力、イベント処理をサポート。
  • uma フィンガープリント: 検出や追跡を回避するためのデバイスフィンガープリントを含む。
  • 高度なクローリング制御: プロキシローテーション、優先度キュー、カスタム再試行ロジック、柔軟なインターバルタイミング(固定またはランダム)。
  • TypeScript対応: ジェネリクスを活用した完全な実装で、強力な型付けを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト