unclecode/crawl4ai
🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN
何を解決するか
Crawl4AI は、大規模言語モデル(LLM)向けにウェブコンテンツを準備することを目的としたオープンソースのウェブクローラーおよびスクレイパーです。ノイズが多く構造のないウェブデータの問題を解決し、RAG(検索拡張生成)、AIエージェント、データパイプラインに最適化されたクリーンで構造化されたMarkdownにページを変換します。
動作方法
このツールは、Playwrightを介して非同期ブラウザプールを使用してウェブページを取得し、さまざまな処理戦略を適用します:
- Markdown生成:BM25アルゴリズムなどのヒューリスティックベースのフィルタリングを使用してノイズを除去し、コア情報を重視した「フィットMarkdown」を生成します。
- 構造化抽出:複雑なデータに対してLLM駆動の抽出をサポートし、高速でスキーマ定義されたJSON出力を得るためのCSS/XPathベースの抽出も可能。
- ブラウザ制御:ブラウザセッション、プロキシ、クッキーを管理し、動的コンテンツや無限スクロールを処理するためのカスタムJavaScriptの実行も可能。
- デプロイ:Pythonライブラリ、CLI、またはDocker化されたFastAPIサーバー(モニタリングダッシュボード付き)として実行可能。
対象ユーザー
- AI開発者:高品質でクリーンなウェブデータを入力として必要とするRAGシステムやAIエージェントの構築者。
- データエンジニア:ボット検出に引っかからず、スケーラブルで制御可能な方法でウェブから構造化データを抽出したいユーザー。
- LLMアプリケーション構築者:プロプライエタリなスクレイピングAPIの料金を支払わず、ウェブを機械可読形式に変換したい開発者。
主な特徴
- LLM対応出力:見出し、表、引用ヒントを含む構造化されたMarkdownを生成。
- ステルスモード:実際のユーザーを模倣してボット検出を回避。
- 適応的インテリジェンス:サイトのパターンを学習し、関連するコンテンツのみを探索。
- 深層クローリング:クラッシュ回復およびプリフェッチモードを備えたBFS戦略をサポートし、より高速な発見を実現。
- 柔軟な抽出:LLM駆動の意味的抽出と高速なCSSベースのスキーマ抽出を組み合わせ可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト