Anakin-Inc/anakin
Open-source web scraping API. Turn any website into clean markdown or structured JSON. Anti-detect browser, proxy auto-selection, self-hosted. One command: make up
解決的問題
AnakinScraper 是專為 AI 應用設計的開源網頁爬取 API。它解決了將複雜、現代的網頁轉換為乾淨、LLM 就緒的 Markdown 或結構化 JSON 數據的問題,同時避開反機器人防護機制,並降低使用付費爬取服務的成本。
工作原理
該系統使用「處理器鏈」來最大化效率並最小化成本。它首先嘗試使用最快的方法(HTTP fetch)爬取頁面,若失敗則回退到更強大的反檢測瀏覽器(Camoufox/Firefox),最後在本地方法失敗時調用可選的外部 API 處理器。
關鍵技術組件包括:
- 反檢測瀏覽器:使用 Camoufox 提供真實的瀏覽器指紋,避免被檢測到。
- 代理自動選擇:採用 Thompson Sampling(一種機器學習技術)即時為特定網域自動選擇最成功的代理。
- AI 提取:與 Google Gemini 集成,將原始頁面內容轉換為結構化 JSON。
- 轉換:自動移除模板程式碼,生成適用於 RAG 流水線的乾淨 Markdown。
適用對象
專為開發 AI 代理、RAG(檢索增強生成)流水線和需要高品質、乾淨網頁數據但無需管理複雜爬取基礎設施的資料提取工具的開發者打造。
主要亮點
- 成本高效的回退機制:僅對本地處理器無法解決的極少數網站調用付費 API。
- 零設定啟動:可作為單個 Go 二進位檔執行,無需資料庫,立即可用。
- 機器學習驅動的代理:透過 Thompson Sampling 即時學習每個網域的最佳代理。
- LLM 就緒輸出:透過 Gemini AI 直接轉換為 Markdown 和結構化 JSON。
- 完整管理 UI:包含基於 React 的儀表板,用於追蹤任務、監控代理評分和管理網域設定。
相關
- 專案
- 專案
- 專案
- 專案
- 專案