coder-hxl/x-crawl
Flexible Node.js AI-assisted crawler library
解決的問題
傳統網頁爬蟲在網站更新其HTML結構或類別名稱時經常失效,因為它們依賴固定的選擇器來尋找資料。x-crawl透過整合AI來理解頁面的語意意義,使其即使在底層程式碼變更時也能準確提取資訊。
工作原理
此套件結合標準的Node.js爬蟲與AI整合(透過OpenAI與Ollama)。它可爬取靜態與動態頁面,處理介面資料,並下載檔案。當使用AI時,開發者可將HTML內容與自然語言指令(例如:「取得圖片連結並移除重複項目」)一併傳遞給AI,以解析並提取特定元素,而無需硬編碼CSS選擇器。
適用對象
需要能適應網站變更的穩健網頁抓取工具的開發者,以及希望使用LLM自動化複雜瀏覽器互動與資料提取的開發者。
主要特色
- AI驅動解析:使用LLM解析語意資訊,減少手動更新選擇器的需求。
- 動態頁面支援:支援在動態頁面上進行自動操作、鍵盤輸入與事件處理。
- uma 指紋辨識:內建裝置指紋功能,以避免被偵測與追蹤。
- 進階爬取控制:支援代理輪換、優先權佇列、可自訂重試邏輯,以及彈性間隔時間(固定或隨機)。
- TypeScript支援:完全以泛型實作,提供強型別支援。
相關
- 專案
- 專案
- 專案
- 專案
- 專案