0xMassi/webclaw

Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.

What it solves

ウェブスクレイピングツールは、ボット保護によってブロックされたり、生の HTML、ナビゲーションメニュー、スクリプト、広告などで乱れたりする出力結果を生成することがよくあります。webclaw は、ウェブサイトをクリーンで構造化されたコンテンツ(Markdown、JSON、または LLM 最適化されたテキスト)に変換することで、AI エージェントや RAG パイプラインですぐに使用できるようにし、この問題を解決します。

How it works

webclaw は、ボイラープレートを削除して構造を維持する抽出エンジンを提供します。CLI ツール、Claude や Cursor のような AI エージェント用の MCP (Model Context Protocol) サーバー、または SDK や REST API を介して使用できます。コアパスのローカル抽出をサポートしており、JavaScript レンダリングやボット保護の回避などの高度なニーズにはホスト型 API を提供しています。

Who it's for

URL またはドキュメントサイト全体から、高品質でノイズのないウェブデータを抽出する必要がある、AI エージェント、RAG (Retrieval-Augmented Generation) システム、および自動化ワークフローを構築している開発者向けです。

Highlights

  • Multiple Output Formats: Markdown、LLM 最適化テキスト、JSON、およびプレーンテキストをサポート。
  • Crawl and Map: リンクを辿ってサイト全体をクロールしたり、完全な抽出なしで URL をマッピングしたりする機能。
  • MCP Integration: MCP サーバーを介して AI エージェントをネイティブにサポートし、エージェントが直接ページをスクレイピング、クロール、要約できるようにします。
  • Local-First Approach: コア抽出は API キーなしでローカルで動作し、複雑なサイト向けにはホスト型オプションがあります。
  • Brand Intelligence: 色、フォント、ロゴなどのブランド資産を抽出するための専用ツール。
  • Broad Integration: TypeScript、Python、および Go 用の SDK を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト