Anakin-Inc/anakin

Open-source web scraping API. Turn any website into clean markdown or structured JSON. Anti-detect browser, proxy auto-selection, self-hosted. One command: make up

何を解決するか

AnakinScraper は AI アプリケーション専用に設計されたオープンソースのウェブスクレイピング API です。複雑な現代のウェブサイトをクリーンで LLM 対応の markdown または構造化 JSON データに変換する問題を解決し、ボット検出防止措置を回避し、有料スクレイピングサービスのコストを削減します。

動作方法

システムは「ハンドラチェーン」を使用して効率を最大化し、コストを最小限に抑えます。最初に最も高速な方法(HTTP fetch)でページをスクレイピングを試み、失敗した場合はより強力なアンチ検出ブラウザ(Camoufox/Firefox)に移行し、最後にローカル手法が失敗した場合にオプションの外部 API ハンドラを使用します。

主な技術的構成要素は以下の通りです:

  • アンチ検出ブラウザ:Camoufox を使用して、検出を回避するための現実的なブラウザフィンガープリントを提供します。
  • プロキシの自動選択:機械学習技術である Thompson Sampling を用いて、リアルタイムで特定のドメインに最も成功するプロキシを自動的に選択します。
  • AI 抽出:Google Gemini と統合し、生のページコンテンツを構造化 JSON に変換します。
  • 変換:自動的にボイラープレートを削除し、RAG パイプライン用のクリーンな markdown を生成します。

対象ユーザー

AIエージェント、RAG(検索拡張生成)パイプライン、高品質でクリーンなウェブデータを必要とするデータ抽出ツールの開発者向けに構築されています。複雑なスクレイピングインフラを管理する必要がありません。

特徴

  • コスト効率の高いフォールバック:ローカルハンドラで解決できないサイトのわずかな割合のみに有料 API を呼び出します。
  • ゼロ構成スタート:データベースなしで単一の Go バイナリとして実行可能で、即座に使用できます。
  • 機械学習駆動のプロキシ:Thompson Sampling を用いて、ドメインごとに最適なプロキシをリアルタイムで学習します。
  • LLM 対応出力:Gemini AI を通じて markdown および構造化 JSON に直接変換可能。
  • 完全な管理 UI:ジョブの追跡、プロキシスコアの監視、ドメイン設定の管理が可能な React ベースのダッシュボードを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト