0xMassi/webclaw
Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.
What it solves
webclaw 解决了网页爬虫工具经常产生的输出内容被机器人防护机制阻挡,或是充斥着原始 HTML、导航菜单、脚本与广告的问题。webclaw 通过将网站转换为干净、结构化的内容(Markdown、JSON 或 LLM 优化的文本),使其能立即用于 AI agent 和 RAG pipeline。
How it works
webclaw 提供了一个提取引擎,可以去除冗余内容并保留结构。它可以作为 CLI 工具、供 Claude 和 Cursor 等 AI agent 使用的 MCP (Model Context Protocol) server,或是通过 SDKs 和 REST API 使用。它支持对核心路径进行本地提取,并提供托管 API 以满足高级需求,例如 JavaScript 渲染和绕过机器人防护。
Who it's for
对于开发者而言,如果您需要从 URL 或整个文档网站进行高质量、无噪声的网页数据提取,webclaw 适合您。这包括构建 AI agent、RAG (Retrieval-Augmented Generation) 系统和自动化工作流的开发者。
Highlights
- Multiple Output Formats: 支持 Markdown、LLM 优化的文本、JSON 和纯文本。
- Crawl and Map: 能够跟随链接爬取整个网站或在不进行完整提取的情况下映射 URL。
- MCP Integration: 通过 MCP server 原生支持 AI agent,允许 agent 直接抓取、爬取并总结页面。
- Local-First Approach: 核心提取功能可以在本地运行,无需 API 密钥,并为复杂网站提供托管选项。
- Brand Intelligence: 专门用于提取品牌资产(如颜色、字体和 Logo)的工具。
- Broad Integration: 提供 TypeScript、Python 和 Go 的 SDKs。
相关
- 项目
- 项目
- 项目
- 项目
- 项目