webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計

webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計 一個網頁擷取工具,可將網站轉換為乾淨的 Markdown、JSON 和 LLM 就緒內容,供 AI 代理人和 RAG 管線使用。

webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計

它解決的問題

網頁擷取工具經常產出要么被機器人偵測阻擋,要么充斥無關的樣板內容(導覽、腳本、廣告),這些內容會雜亂 AI 代理人和 RAG 管線的上下文視窗。webclaw 將網站轉換為乾淨且結構化的格式,如 Markdown 或 JSON,移除噪音並提供 LLM 就緒的內容。

它是如何運作的

webclaw 提供一個核心擷取引擎,將 HTML 處理為簡化的格式。它提供多種與工具互動的方式:

  • Local Execution: 一個 CLI 和 MCP 伺服器,無需帳戶即可進行基本擷取。
  • Hosted API: 一項雲端服務,用於處理 JavaScript 渲染、受 bot 保護的網站以及複雜的研究任務。
  • SDKs: 用於 TypeScript、Python 和 Go 的函式庫,可將擷取功能整合到應用程式中。
  • MCP Server: 一個 Model Context Protocol 伺服器,允許 AI 代理人(如 Claude 或 Cursor)將擷取和爬取視為原生工具使用。

它的目標對象

正在構建 AI 代理人、RAG(檢索增強生成)管線的開發者,以及需要將雜亂的網頁轉換為高品質結構化資料以供 LLMs 使用的研究人員。

主要特點

  • LLM-Optimized Formats: 專為 Markdown、JSON 以及供代理人使用的緊湊 llm 格式設計的輸出。
  • Agent Integration: 提供 MCP 的原生支援,使代理人能直接擷取、爬取和總結頁面。
  • Crawl and Map: 能夠跟隨連結來探索並擷取完整的文件站點。
  • Local-First Approach: 核心擷取邏輯在本地可用,同時提供雲端 API 以滿足如 JS 渲染等進階需求。
  • Brand Intelligence: 專門用於提取品牌資產(如顏色、字體和標誌)的工具。

Sources