getmaxun/maxun

🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥

解決的問題

Maxun 提供了一個無程式碼平台,可將非結構化 Web 內容轉換為結構化、可靠的數據。它消除了為每個網站編寫自定義抓取腳本的需求,允許用戶在沒有技術專業知識的情況下大規模獲取網路數據。

工作原理

該平台使用「機器人」(模擬真實用戶行為進行導航與數據收集的自動化工具)。它提供四種主要的運行模式:

  • Extract: 使用 Recorder Mode(記錄用戶操作)或 AI Mode(使用自然語言描述來引導 LLM 驅動的提取)來捕獲結構化數據。
  • Scrape: 將網頁轉換為乾淨的 Markdown 或 HTML,專門為 AI 代理與文件處理進行了優化。
  • Crawl: 根據定義的範圍,遍歷整個網站以從所有相關頁面提取內容。
  • Search: 自動執行網路搜尋,使用基於時間的篩選器來發現並抓取結果。

適用對象

專為需要 Web 數據進行潛在客戶生成、市場研究與內容聚合的非技術用戶,以及希望透過 SDK 或 CLI 集成抓取與提取工作流的開發人員而設計。

亮點

  • 無程式碼介面: 點選式數據提取。
  • LLM 驅動的提取: 使用自然語言定義要抓取的數據。
  • Website-to-API: 將任何網站轉換為 RESTful 端點。
  • AI 就緒數據: 生成用於 LLM 應用程式的乾淨 Markdown。
  • 自動化: 支援排程、分頁與身份驗證(提取登入後的數據)。
  • 可自託管: 開源,可以透過 Docker 部署。