apache/texera
Human-AI Collaborative Data Science Using Visual Workflows
Apache Texera – 視覚的で人間とAIが協働するデータサイエンスプラットフォーム
何であるか
- データ分析パイプラインをWebベースの視覚エディタで構築・実行・調整できる、オープンソースのApache Incubatingプロジェクト。
- システム内に搭載されたAIエージェントが自然言語の指示を理解し、コードを書かずに演算子の追加、パラメータの変更、データの探索が可能。
コア機能
| 機能 | 得られるもの |
|---|---|
| 自然言語によるデータサイエンス | 「年齢 > 30 の行をフィルタ」などのコマンドを発話または入力し、AIエージェントがワークフロー演算子に変換。 |
| GUI駆動のワークフロー | Python、Java、SQLなどノードをキャンバスにドラッグアンドドロップし、接続してクリックで実行。 |
| リアルタイム共同作業 | 複数ユーザーが同じワークフローを同時に編集でき、変更内容をリアルタイムで確認可能。 |
| インタラクティブデバッグ | 中間結果を確認、実行を一時停止/再開、実行中にパイプラインを動的に変更可能。 |
| 言語非依存のランタイム | ノードはPythonまたはJavaで記述可能。エンジンは両者を一様に扱う。 |
| スケーラブルな並列エンジン | バックエンドがコアやクラスタにワークロードを分散し、ラップトップから100ノード・400コアの展開まで大規模データ処理を可能に。 |
| 計算とストレージの分離 | ストレージはローカルファイルやクラウドオブジェクトストアなどに簡単に切り替え可能。計算層に影響を与えず、クラウド展開を簡素化。 |
一般的な利用事例
- 科学者向けの探索的データ分析:直感的な視覚フィードバックを提供しつつ、高度なAIモデルを呼び出せる。
- 科学向けAIパイプライン:ドメイン専門家が自然言語で機械学習ステップ(特徴抽出、モデル学習、結果解釈)をガイド。
- チーム分析プロジェクト:共有・バージョン管理されたワークフローとリアルタイム共同作業を必要とする。
- データサイエンスの教育:ボイラープレートコードを隠す直感的なインターフェースで学習を支援。
導入方法
- ローカルで実行 – リポジトリをクローンし、Docker-composeスタックを起動(
docker compose up)。Web UIはhttp://localhost:3000で利用可能。 - ワークフローを作成 – Source ノード(CSV、データベースなど)をドラッグアンドドロップし、処理ノード(フィルタ、マップ、MLモデル)に接続し、Sink(ファイル、ダッシュボード)で終了。
- AIに依頼 – チャット風のアシスタントパネルを開き、自然言語コマンドを入力。システムが自動的にノードを追加または変更。
- スケールアウト – 大規模なジョブの場合は、バックエンドをクラウドVMクラスタにデプロイ。システムが利用可能なコアに演算子を自動分散。
コミュニティと影響
- ユーザー数:332人以上登録
- 構築されたプロジェクト数:86件
- 実行されたワークフロー数:2,481(51,000以上の個別実行、357,000回のバージョン管理実行)
- デプロイメント:7件の公開デプロイメント、最大は100ノード/400コア
- 論文:VLDB 2024で論文に記載(引用情報あり)。
さらに学ぶには
- 公式サイト:https://texera.apache.org/
- READMEからデモ動画、ブログ記事、ドキュメントへのリンクあり。
Apache Texeraは視覚的ワークフロー設計と会話型AIを統合し、専門的なプログラミングスキルがなくても高度なデータサイエンスパイプラインにアクセスできるようにします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト