getmaxun/maxun

🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥

解決する課題

Maxunは、非構造化されたウェブコンテンツを構造化された信頼性の高いデータに変換するためのノーコードプラットフォームを提供します。各ウェブサイトに対してカスタムスクレイピングスクリプトを記述する必要がなくなり、技術的な専門知識がなくても大規模にウェブからデータを取得できるようになります。

仕組み

このプラットフォームは、実際のユーザーの行動を模倣してナビゲーションやデータ収集を行う自動化ツール「ロボット」を使用します。主に4つの動作モードがあります:

  • Extract: Recorder Mode(ユーザーの操作を記録)または AI Mode(自然言語による指示でLLMを活用した抽出)を使用して、構造化データを取得します。
  • Scrape: ウェブページを、AIエージェントやドキュメント処理に最適化されたクリーンなMarkdownまたはHTMLに変換します。
  • Crawl: 定義された範囲に基づいて、関連するすべてのページからコンテンツを抽出するためにウェブサイト全体をナビゲートします。
  • Search: ウェブ検索を自動化し、時間ベースのフィルターを使用して結果を検索・スクレイピングします。

対象ユーザー

リードジェネレーション、市場調査、コンテンツ集約のためにウェブデータを必要とする非技術的なユーザー、およびSDKやCLIを介してスクレイピングや抽出ワークフローを統合したい開発者のために設計されています。

ハイライト

  • ノーコードインターフェース: ポイント&クリックによるデータ抽出。
  • LLMによる抽出: 自然言語を使用して、どのデータをスクレイピングするかを定義。
  • Website-to-API: あらゆるウェブサイトをRESTfulエンドポイントに変換。
  • AI対応データ: LLMアプリケーションで使用できるクリーンなMarkdownを生成。
  • 自動化: スケジュール設定、ページネーション、認証(ログイン後のデータ抽出)をサポート。
  • セルフホスト可能: オープンソースであり、Docker経由でデプロイ可能。