unclecode/crawl4ai

🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN

何を解決するか

Crawl4AI は、大規模言語モデル(LLM)向けにウェブコンテンツを準備することを目的としたオープンソースのウェブクローラーおよびスクレイパーです。ノイズが多く構造のないウェブデータの問題を解決し、RAG(検索拡張生成)、AIエージェント、データパイプラインに最適化されたクリーンで構造化されたMarkdownにページを変換します。

動作方法

このツールは、Playwrightを介して非同期ブラウザプールを使用してウェブページを取得し、さまざまな処理戦略を適用します:

  • Markdown生成:BM25アルゴリズムなどのヒューリスティックベースのフィルタリングを使用してノイズを除去し、コア情報を重視した「フィットMarkdown」を生成します。
  • 構造化抽出:複雑なデータに対してLLM駆動の抽出をサポートし、高速でスキーマ定義されたJSON出力を得るためのCSS/XPathベースの抽出も可能。
  • ブラウザ制御:ブラウザセッション、プロキシ、クッキーを管理し、動的コンテンツや無限スクロールを処理するためのカスタムJavaScriptの実行も可能。
  • デプロイ:Pythonライブラリ、CLI、またはDocker化されたFastAPIサーバー(モニタリングダッシュボード付き)として実行可能。

対象ユーザー

  • AI開発者:高品質でクリーンなウェブデータを入力として必要とするRAGシステムやAIエージェントの構築者。
  • データエンジニア:ボット検出に引っかからず、スケーラブルで制御可能な方法でウェブから構造化データを抽出したいユーザー。
  • LLMアプリケーション構築者:プロプライエタリなスクレイピングAPIの料金を支払わず、ウェブを機械可読形式に変換したい開発者。

主な特徴

  • LLM対応出力:見出し、表、引用ヒントを含む構造化されたMarkdownを生成。
  • ステルスモード:実際のユーザーを模倣してボット検出を回避。
  • 適応的インテリジェンス:サイトのパターンを学習し、関連するコンテンツのみを探索。
  • 深層クローリング:クラッシュ回復およびプリフェッチモードを備えたBFS戦略をサポートし、より高速な発見を実現。
  • 柔軟な抽出:LLM駆動の意味的抽出と高速なCSSベースのスキーマ抽出を組み合わせ可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト