tinyfish-io/bigset-oss

Open-source BigSet — self-hostable live datasets populated by TinyFish web agents

何を解決するか

BigSet は、プレーンな英語の記述を使ってライブウェブから検証済みの構造化データセットを生成できる AI ベースのツールです。手動で検索 API やスクレイピングフレームワーク、スキーマ設計、スケジューリングツールを組み合わせる作業を排除し、最新のデータテーブルを構築・維持できます。

動作方法

  1. 記述: ユーザーが望むデータセットの自然言語記述を提供します。
  2. スキーマ推論: AI が必要なカラム名、データ型、プライマリキーを自動的に決定します。
  3. 発見: オーケストレーター・エージェントがウェブ検索を使って関連するエンティティを特定します。
  4. データ充填: 並列で動作するサブエージェントが各エンティティを調査し、リアルタイムデータを取得・ソースと照合して検証します。
  5. 出力: 構造化されたデータは UI で表示され、CSV や XLSX としてエクスポート可能です。
  6. メンテナンス: ユーザーは 30 分から週単位まで設定可能なリフレッシュスケジュールを設定し、データを自動的に最新状態に保つことができます。

対象ユーザー

カスタムスクレイパーを書かずに、公開ウェブページから検証済みで構造化され、定期的に更新されたデータが必要な研究者、リードジェネレーション専門家、AIエージェント開発者。

特徴

  • 自律的調査: 静的スクレイピングに頼らず、エージェントを使って検索・取得・検証を行います。
  • 自動スキーマ: ユーザーのプロンプトからテーブル構造を自動的に推論します。
  • スケジュールリフレッシュ: データセットが古くなるのを防ぐための、cron に似た機能を内蔵しています。
  • CLI サポート: コマンドラインインターフェースを備えており、プログラム的にデータセットの作成・エクスポートが可能です。
  • 統合: ウェブ検索とページ取得には TinyFish APIs を使用しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト