apache/texera

Human-AI Collaborative Data Science Using Visual Workflows

Apache Texera – 可视化、人机协作的数据科学平台

是什么

  • 一个开源的 Apache Incubating 项目,允许分析师通过基于 Web 的可视化编辑器构建、运行和调整数据分析流水线。
  • 系统内部的 AI 代理能够理解自然语言指令,因此用户无需编写代码即可要求平台添加算子、更改参数或探索数据。

核心功能

功能 你将获得
自然语言数据科学 输入或说出命令(例如 “筛选年龄大于30的行”),AI 代理会将其转换为工作流算子。
GUI 驱动的工作流 将 Python、Java、SQL 等节点拖拽到画布上,连接它们,并点击即可执行。
实时协作 多个用户可以同时编辑同一工作流,实时查看彼此的更改。
交互式调试 检查中间结果,暂停/恢复执行,并在运行时动态修改流水线。
语言无关的运行时 节点可用 Python 或 Java 编写;引擎对两者一视同仁。
可扩展的并行引擎 后端将工作分布在核心或集群上,支持从笔记本电脑到 100 节点、400 核部署的大数据处理。
计算与存储分离 存储可轻松更换(例如本地文件、云对象存储),无需修改计算层,简化云部署。

典型应用场景

  • 探索性数据分析:科学家希望快速获得可视化反馈,同时仍能调用复杂的 AI 模型。
  • 科学领域的 AI 流水线:领域专家通过自然语言指导机器学习步骤(特征提取、模型训练、结果解释)。
  • 团队分析项目:需要共享、版本化的工作流和实时协作。
  • 教学数据科学概念:使用直观界面隐藏样板代码,便于学习。

快速入门

  1. 本地运行 – 克隆仓库并启动 Docker-compose 堆栈(docker compose up)。Web UI 可通过 http://localhost:3000 访问。
  2. 创建工作流 – 拖拽一个 Source 节点(CSV、数据库等),连接到处理节点(过滤、映射、ML 模型),最后以 Sink(文件、仪表板)结束。
  3. 向 AI 提问 – 打开类似聊天的助手面板,输入自然语言命令,观察系统自动添加或修改节点。
  4. 扩展部署 – 对于更大任务,将后端部署到云 VM 集群;系统会自动将算子分发到可用核心上。

社区与影响

  • 用户数:332+ 注册用户
  • 构建项目数:86 个
  • 执行工作流数:2,481(超过 51,000 次独立执行,357,000 次版本化运行)
  • 部署实例:7 个公开部署,最大规模为 100 节点 / 400 核
  • 发表论文:在 VLDB 2024 论文中被描述(引用信息已提供)。

了解更多


Apache Texera 将可视化工作流工程与对话式 AI 相结合,使不具备专业编程技能的分析人员也能轻松使用复杂的数据分析流水线。

相关

  • 项目
  • 项目
  • 项目
  • 项目