apache/texera

Human-AI Collaborative Data Science Using Visual Workflows

Apache Texera – 視覺化、人機協作型資料科學平台

是什麼

  • 一個開源的 Apache Incubating 專案,讓分析師透過基於 Web 的視覺化編輯器建構、執行與調整資料分析流程。
  • 系統內的 AI 代理能理解自然語言指令,因此使用者無需撰寫程式碼,即可要求平台新增運算子、變更參數或探索資料。

核心功能

功能 你將獲得
自然語言資料科學 說出或輸入指令(例如 「過濾年齡大於 30 的資料」),AI 代理會將其轉換為工作流程運算子。
GUI 驅動的工作流程 將 Python、Java、SQL 等節點拖曳至畫布上,連接並點擊即可執行。
即時協作 多位使用者可同時編輯同一工作流程,即時看見彼此的變更。
互動式除錯 檢視中間結果,暫停/恢復執行,並在執行中動態修改流程。
語言無關的執行時 節點可用 Python 或 Java 編寫;引擎對兩者一視同仁。
可擴展的平行引擎 後端將工作分散至核心或叢集,支援從筆電到 100 節點、400 核部署的大數據處理。
計算與儲存分離 儲存可輕鬆更換(例如本機檔案、雲端物件儲存),無需觸及計算層,簡化雲端部署。

典型應用場景

  • 探索性資料分析:科學家希望快速獲得視覺化反饋,同時仍能呼叫複雜的 AI 模型。
  • 科學領域的 AI 流程:領域專家透過自然語言引導機器學習步驟(特徵萃取、模型訓練、結果解讀)。
  • 團隊分析專案:需要共享、版本化的工作流程與即時協作。
  • 教學資料科學概念:使用直覺式介面隱藏重複程式碼,便於學習。

快速上手

  1. 本地執行 – 克隆程式碼庫並啟動 Docker-compose 堆疊(docker compose up)。Web UI 可透過 http://localhost:3000 存取。
  2. 建立工作流程 – 拖曳一個 Source 節點(CSV、資料庫等),連接到處理節點(過濾、映射、ML 模型),最後以 Sink(檔案、儀表板)結束。
  3. 向 AI 提問 – 開啟類似聊天的助理面板,輸入自然語言指令,觀察系統自動新增或修改節點。
  4. 擴展部署 – 對於大型作業,將後端部署至雲端 VM 叢集;系統會自動將運算子分發至可用核心。

社群與影響

  • 使用者數:332+ 登記使用者
  • 建構專案數:86 個
  • 執行工作流程數:2,481(超過 51,000 次獨立執行,357,000 次版本化執行)
  • 部署案例:7 個公開部署,最大規模為 100 節點 / 400 核
  • 發表論文:於 VLDB 2024 論文中描述(引用資訊已提供)。

進一步了解


Apache Texera 將視覺化工作流程工程與對話式 AI 結合,讓即使非專業程式設計師的分析人員也能輕鬆使用高階資料科學流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案