0xMassi/webclaw
Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.
何を解決するか
ウェブスクレイピングツールは、ボット検出によってブロックされた出力またはナビゲーション、スクリプト、広告などの関係のないボイラープレートでいっぱいの出力を生成することがよくあります。これにより、AIエージェントやRAGパイプラインのコンテキストウィンドウがごちゃごちゃになります。webclawは、ウェブサイトをMarkdownやJSONなどのクリーンで構造化された形式に変換し、ノイズを取り除いてLLMに適したコンテンツを提供します。
仕組み
webclawは、HTMLをシンプルな形式に処理するコア抽出エンジンを提供します。以下の複数の方法でツールとやり取りできます:
- ローカル実行: アカウント不要で基本的な抽出ができるCLIとMCPサーバー。
- ホスト型API: JavaScriptレンダリング、ボット保護サイト、複雑なリサーチジョブを処理するクラウドサービス。
- SDK: TypeScript、Python、Go向けのライブラリで、アプリケーションへの抽出の統合を可能にします。
- MCPサーバー: AIエージェント(ClaudeやCursorなど)がスクレイピングやクローリングをネイティブツールとして使用できるModel Context Protocolサーバー。
対象者
AIエージェント、RAG(検索拡張生成)パイプラインを構築する開発者、そしてLLM向けの高品質で構造化されたデータに乱雑なウェブページを変換する必要がある研究者向けです。
ハイライト
- LLM最適化フォーマット: エージェント向けに設計されたMarkdown、JSON、およびコンパクトな
llm形式の出力。 - エージェント統合: MCPのネイティブサポートにより、エージェントはページを直接スクレイピング、クローリング、要約できます。
- クロールとマップ: ドキュメントサイト全体を発見および抽出するためにリンクをたどる機能。
- ローカルファーストアプローチ: コア抽出ロジックはローカルで利用可能であり、JSレンダリングなどの高度なニーズにはホスト型APIを提供します。
- ブランドインテリジェンス: 色、フォント、ロゴなどのブランド資産を抽出するための専用ツール。