webclaw: 一个将网站转换为干净的 Markdown 和结构化数据的网页提取引擎,供 AI 代理使用

webclaw: 一个将网站转换为干净的 Markdown 和结构化数据的网页提取引擎,供 AI 代理使用

它解决的问题

网页抓取工具经常产生的输出要么被机器人检测阻止,要么充斥着无关的样板代码(导航、脚本、广告),这些会杂乱 AI 代理和 RAG 管道的上下文窗口。webclaw 将网站转换为如 Markdown 或 JSON 等干净、结构化的格式,去除噪声并提供 LLM 就绪的内容。

它是如何工作的

webclaw 提供一个核心提取引擎,将 HTML 处理为简化的格式。它提供了多种与该工具交互的方式:

  • Local Execution: 一个无需账户即可工作的 CLI 和 MCP 服务器,用于基本提取。
  • Hosted API: 一个云服务,用于处理 JavaScript 渲染、受机器人保护的站点以及复杂的研究任务。
  • SDKs: 用于 TypeScript、Python 和 Go 的库,以便将提取集成到应用程序中。
  • MCP Server: 一个 Model Context Protocol 服务器,允许 AI 代理(如 Claude 或 Cursor)将抓取和爬取作为原生工具使用。

它适用于谁

构建 AI 代理、RAG(检索增强生成)管道和需要将混乱的网页转换为高质量结构化数据以供 LLMs 使用的开发者和研究人员。

亮点

  • LLM-Optimized Formats: 专门为代理设计的输出,适用于 Markdown、JSON 和紧凑的 llm 格式。
  • Agent Integration: 对 MCP 的原生支持,使代理能够直接抓取、爬取和总结页面。
  • Crawl and Map: 能够跟随链接以发现并提取整个文档站点。
  • Local-First Approach: 核心提取逻辑在本地可用,同时提供托管 API 以满足如 JS 渲染等高级需求。
  • Brand Intelligence: 用于提取品牌资产(如颜色、字体和徽标)的专用工具。

Sources