0xMassi/webclaw
Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.
What it solves
ウェブスクレイピングツールは、ボット保護によってブロックされたり、生の HTML、ナビゲーションメニュー、スクリプト、広告などで乱れたりする出力結果を生成することがよくあります。webclaw は、ウェブサイトをクリーンで構造化されたコンテンツ(Markdown、JSON、または LLM 最適化されたテキスト)に変換することで、AI エージェントや RAG パイプラインですぐに使用できるようにし、この問題を解決します。
How it works
webclaw は、ボイラープレートを削除して構造を維持する抽出エンジンを提供します。CLI ツール、Claude や Cursor のような AI エージェント用の MCP (Model Context Protocol) サーバー、または SDK や REST API を介して使用できます。コアパスのローカル抽出をサポートしており、JavaScript レンダリングやボット保護の回避などの高度なニーズにはホスト型 API を提供しています。
Who it's for
URL またはドキュメントサイト全体から、高品質でノイズのないウェブデータを抽出する必要がある、AI エージェント、RAG (Retrieval-Augmented Generation) システム、および自動化ワークフローを構築している開発者向けです。
Highlights
- Multiple Output Formats: Markdown、LLM 最適化テキスト、JSON、およびプレーンテキストをサポート。
- Crawl and Map: リンクを辿ってサイト全体をクロールしたり、完全な抽出なしで URL をマッピングしたりする機能。
- MCP Integration: MCP サーバーを介して AI エージェントをネイティブにサポートし、エージェントが直接ページをスクレイピング、クロール、要約できるようにします。
- Local-First Approach: コア抽出は API キーなしでローカルで動作し、複雑なサイト向けにはホスト型オプションがあります。
- Brand Intelligence: 色、フォント、ロゴなどのブランド資産を抽出するための専用ツール。
- Broad Integration: TypeScript、Python、および Go 用の SDK を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト