0xMassi/webclaw
Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.
什麼問題被解決
網頁抓取工具經常產出的結果要么被機器人偵測阻擋,要么充斥著無關的樣板內容(導覽、腳本、廣告),這些會雜亂 AI 代理和 RAG 管道的上下文視窗。webclaw 會將網站轉換為乾淨且結構化的格式,如 Markdown 或 JSON,移除噪音並提供 LLM 可直接使用的內容。
它是如何運作的
webclaw 提供一個核心擷取引擎,將 HTML 處理為簡化的格式。它提供多種與工具互動的方式:
- 本地執行: 一個 CLI 和 MCP 伺服器,無需帳戶即可進行基本擷取。
- 託管 API: 一項雲端服務,用於處理 JavaScript 渲染、受 bot 保護的網站以及複雜的研究任務。
- SDKs: 提供 TypeScript、Python 和 Go 的函式庫,以將擷取功能整合到應用程式中。
- MCP 伺服器: 一個 Model Context Protocol 伺服器,使 AI 代理(如 Claude 或 Cursor)能將擷取和爬取視為原生工具使用。
適合對象
開發 AI 代理、RAG(檢索增強生成)管道以及需要將雜亂的網頁轉換為高品質結構化資料以供 LLM 使用的開發者和研究人員。
特色
- LLM-Optimized Formats: 專門為代理設計的 Markdown、JSON 以及緊湊的
llm格式輸出。 - Agent Integration: 原生支援 MCP,使代理能直接抓取、爬取並總結頁面。
- Crawl and Map: 能夠跟隨連結來探索並擷取完整的文件站點。
- Local-First Approach: 核心擷取邏輯可在本地使用,進階需求(如 JS 渲染)則透過託管 API 提供。
- Brand Intelligence: 專門用於擷取品牌資產(如顏色、字體、標誌)的工具。