getmaxun/maxun
🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥
Maxun – 将任何网站转换为结构化 API
什么是它
- 一个开源、无代码平台,可让你从网络收集数据并将其转换为整洁、结构化的输出(JSON、CSV、Markdown 等)。
- 它集成了可视化 UI、一组“机器人”(预构建的自动化代理)、CLI 和 SDK,因此你可以通过本地、Docker 或托管服务运行相同的流程。
为什么它对 AI / ML 很重要
- 现代 LLM 应用需要高质量、结构化的数据。Maxun 可以抓取网站、爬取整个域名,或从 PDF 和图像中提取信息,然后以适用于提示词(prompting)或微调(fine-tuning)的格式输出数据。
- 它提供了一种 LLM 驱动的提取模式:你可以用自然语言描述你想要的字段,系统会使用语言模型来定位并返回它们,从而减少了手动编写选择器(selectors)的需求。
关键组件
| 组件 | 功能 | AI 相关功能 |
|---|---|---|
| Extract | 通过点击或记录浏览会话,然后回放以提取结构化数据。 | AI Mode – 使用 LLM 来指定提取内容,而不是编写选择器。 |
| Scrape | 将完整页面保存为整洁的 Markdown/HTML,并可以捕获截图。 | 输出适用于 LLM 的 Markdown,用于下游提示词。 |
| Crawl | 遍历整个网站,遵循范围规则,并从每个页面提取数据。 | 可以将大型语料库输入到向量存储或训练流水线中。 |
| Search | 自动化网络搜索并收集结果,带有基于时间的过滤器。 | 有助于为检索增强生成(RAG)收集新鲜数据。 |
| Document Extraction | 解析 PDF、DOCX、XLSX、CSV 并对图像进行 OCR。 | 将扫描文档转换为适用于 LLM 摄入的结构化文本。 |
| SDK / CLI | 程序化控制、调度和机器人管理。 | 支持集成到自定义 AI 流水线或 CI/CD 中。 |
如何使用它
- Hosted quick‑start – 前往
https://app.maxun.dev并通过 Web UI 创建一个机器人。 - Self‑host – 使用 Docker Compose 或直接安装在本地运行服务(参见文档)。这让你对数据和计算拥有完全的控制权。
- Automation – 调度机器人定期运行,通过 REST 端点暴露提取的数据,或直接推送到 Google Sheets/Airtable。
- LLM integration – 该平台可以以 Model Context Protocol (MCP) 格式输出数据,从而可以轻松地将结果喂给 LLM 提示词或检索增强流水线。
适合人群
- 数据工程师 & ML 团队,需要一种可靠的方式来获取网络数据,而无需从头编写爬虫。
- 产品构建者,正在创建需要最新网络信息的 AI 代理。
- 研究人员,正在收集大型语料库用于训练或评估。
- 非技术用户,可以使用可视化记录器来构建提取流程。
License
- AGPL‑v3,这意味着代码可以免费使用和修改,但任何网络部署的服务必须共享其源代码更改。
Bottom line Maxun 弥补了原始网络内容与现代 AI 系统所需的整洁、结构化数据集之间的鸿沟,既提供了无代码 UI,又为自动化和集成提供了开发者友好的工具。
相关
- 项目
- 项目
- 项目
- 项目