webclaw: ウェブサイトをクリーンなマークダウンと構造化データに変換するウェブ抽出エンジン(AIエージェント向け)
webclaw: ウェブサイトをクリーンなマークダウンと構造化データに変換するウェブ抽出エンジン(AIエージェント向け)
What it solves
ウェブスクレイピングツールは、ボット検出によってブロックされるか、ナビゲーション、スクリプト、広告などの関係のないボイラープレートでいっぱいになる出力を生成することがよくあります。これにより、AIエージェントとRAGパイプラインのコンテキストウィンドウが乱雑になります。webclawは、ウェブサイトをマークダウンやJSONなどのクリーンで構造化されたフォーマットに変換し、ノイズを取り除いてLLM用のコンテンツを提供します。
How it works
webclawは、HTMLをシンプルなフォーマットに処理するコア抽出エンジンを提供します。以下の複数の方法でツールとやり取りできます:
- ローカル実行: アカウント不要で基本的な抽出が可能なCLIとMCPサーバー。
- ホスト型API: JavaScriptレンダリング、ボット保護サイト、複雑なリサーチジョブを処理するクラウドサービス。
- SDK: TypeScript、Python、Go向けのライブラリで、アプリケーションへの抽出の統合を可能にします。
- MCPサーバー: Model Context Protocolサーバーで、AIエージェント(ClaudeやCursorなど)がスクレイピングとクローリングをネイティブツールとして使用できるようになります。
Who it’s for
AIエージェント、RAG(検索拡張生成)パイプライン、およびLLM用の高品質な構造化データに変換する必要がある研究者向けに、ウェブページを整理して開発する開発者。
Highlights
- LLM最適化フォーマット: エージェント向けに設計されたマークダウン、JSON、およびコンパクトな
llmフォーマットの出力。 - エージェント統合: MCPのネイティブサポートにより、エージェントはページを直接スクレイピング、クローリング、要約できます。
- クロールとマップ: リンクをたどってドキュメントサイト全体を発見および抽出する機能。
- ローカルファーストアプローチ: コア抽出ロジックはローカルで利用可能であり、JSレンダリングなどの高度なニーズにはホスト型APIを提供します。
- ブランドインテリジェンス: 色、フォント、ロゴなどのブランド資産を抽出する専用ツール。
Sources
- Repo0xMassi/webclaw