coder-hxl/x-crawl
Flexible Node.js AI-assisted crawler library
何を解決するか
従来のウェブクローラーは、ウェブサイトのHTML構造やクラス名が更新されると頻繁に破綻します。これは、固定されたセレクタに依存してデータを検出するためです。x-crawlはAIを統合し、ページの意味的意味を理解することで、下位のコードが変更されても正確に情報を抽出できるようにします。
動作方法
このライブラリは標準のNode.jsクローラーとAI統合(OpenAIおよびOllama経由)を組み合わせています。静的ページおよび動的ページのクロールが可能で、インターフェースデータの処理やファイルのダウンロードもサポートしています。AIを使用する場合、開発者は自然言語の指示(例:"画像リンクを取得し、重複を削除する")とともにHTMLコンテンツをAIに渡すことで、ハードコードされたCSSセレクタなしに特定の要素を解析・抽出できます。
対象ユーザー
ウェブサイトの変更に適応できる堅牢なウェブスクレイピングツールが必要な開発者、およびLLMを活用して複雑なブラウザ操作とデータ抽出を自動化したい開発者。
特徴
- AI駆動のパース: LLMを使用して意味情報をパースし、手動でのセレクタ更新の必要性を低減。
- 動的ページ対応: 動的ページでの自動操作、キーボード入力、イベント処理をサポート。
- uma フィンガープリント: 検出や追跡を回避するためのデバイスフィンガープリントを含む。
- 高度なクローリング制御: プロキシローテーション、優先度キュー、カスタム再試行ロジック、柔軟なインターバルタイミング(固定またはランダム)。
- TypeScript対応: ジェネリクスを活用した完全な実装で、強力な型付けを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト