0xMassi/webclaw

Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.

解決的問題

網頁爬蟲工具經常產生被機器人防護機制阻擋,或充斥著原始 HTML、導航選單、腳本和廣告的輸出。webclaw 透過將網站轉換為乾淨、結構化的內容(Markdown、JSON 或 LLM 標準化文字),解決此問題,讓內容可立即用於 AI 代理與 RAG 流程。

如何運作

webclaw 提供一個提取引擎,可移除冗餘內容並保留結構。它可作為 CLI 工具、AI 代理(如 Claude 和 Cursor)使用的 MCP(Model Context Protocol)伺服器,或透過 SDK 與 REST API 使用。它支援核心路徑的本機提取,以及需要 JavaScript 渲染或繞過機器人防護等進階需求的主機 API。

適用對象

需要從 URL 或整個文件網站中提取高品質、無雜訊網路資料的開發者,特別是建構 AI 代理、RAG(檢索增強生成)系統與自動化工作流程的人。

主要特色

  • 多種輸出格式:支援 Markdown、LLM 標準化文字、JSON 與純文字。
  • 爬取與地圖功能:可追蹤連結以爬取整個網站,或僅建立 URL 地圖而不進行完整提取。
  • MCP 整合:原生支援透過 MCP 伺服器讓 AI 代理直接進行爬取、爬行與摘要頁面。
  • 本機優先設計:核心提取功能可在無需 API 金鑰的情況下於本機運作,複雜網站則可選擇主機選項。
  • 品牌智慧:專用工具可提取品牌資產,如顏色、字型與商標。
  • 廣泛整合:提供 TypeScript、Python 與 Go 的 SDK。

"webclaw 讓我們能快速將網站轉換為 AI 可用的結構化資料,大幅簡化了 RAG 系統的資料準備流程。" — @devjoe

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案