apache/texera

Human-AI Collaborative Data Science Using Visual Workflows

Apache Texera – 시각적이고 인간-AI 협업형 데이터 과학 플랫폼

무엇인가요

  • 분석가가 웹 기반 시각 편집기를 통해 데이터 분석 파이프라인을 구축, 실행, 조정할 수 있는 오픈소스 Apache Incubating 프로젝트입니다.
  • 시스템 내부의 AI 에이전트가 자연어 명령을 이해하므로, 코드를 작성하지 않고도 연산자 추가, 파라미터 변경, 데이터 탐색이 가능합니다.

핵심 기능

기능 제공되는 기능
자연어 기반 데이터 과학 "나이가 30 이상인 행을 필터링"과 같은 명령을 말하거나 입력하면 AI 에이전트가 워크플로우 연산자로 변환합니다.
GUI 기반 워크플로우 Python, Java, SQL 등 노드를 캔버스에 드래그 앤 드롭하여 연결하고, 클릭 한 번으로 실행합니다.
실시간 공동 작업 여러 사용자가 동시에 동일한 워크플로우를 편집하며, 상대방의 변경 사항을 실시간으로 확인할 수 있습니다.
인터랙티브 디버깅 중간 결과를 검사하고, 실행을 일시정지/재개하며, 실시간으로 파이프라인을 수정할 수 있습니다.
언어 독립적 런타임 노드는 Python 또는 Java로 작성 가능하며, 엔진은 둘을 동일하게 처리합니다.
확장 가능한 병렬 엔진 백엔드가 코어 또는 클러스터에 작업을 분산하여, 랩톱에서부터 100노드/400코어까지의 대규모 데이터 처리를 가능하게 합니다.
계산과 저장소 분리 로컬 파일, 클라우드 객체 스토어 등으로 저장소를 쉽게 교체 가능하며, 계산 계층에 영향을 주지 않아 클라우드 배포를 간소화합니다.

주요 활용 사례

  • 과학자들을 위한 탐색적 데이터 분석: 빠른 시각 피드백을 제공하면서도 고도화된 AI 모델을 호출할 수 있습니다.
  • 과학을 위한 AI 파이프라인: 도메인 전문가가 자연어로 기계학습 단계(특징 추출, 모델 학습, 결과 해석)를 안내합니다.
  • 팀 분석 프로젝트: 공유되고 버전 관리되는 워크플로우와 실시간 협업이 필요한 경우.
  • 데이터 과학 개념 교육: 반복 코드를 숨기고 직관적인 인터페이스로 학습을 지원합니다.

시작하기

  1. 로컬에서 실행 – 리포지토리 복제 후 Docker-compose 스택 시작 (docker compose up). 웹 UI는 http://localhost:3000에서 접근 가능.
  2. 워크플로우 생성Source 노드(CSV, 데이터베이스 등)를 드래그하여 연결하고, 처리 노드(필터, 맵, ML 모델)를 거쳐 Sink (파일, 대시보드)로 마무리.
  3. AI에 요청 – 채팅형 어시스턴트 패널을 열고 자연어 명령을 입력하면 시스템이 자동으로 노드를 추가하거나 수정합니다.
  4. 확장 배포 – 대규모 작업의 경우 백엔드를 클라우드 VM 클러스터에 배포하고, 시스템이 사용 가능한 코어에 자동으로 연산자를 분산합니다.

커뮤니티 및 영향력

  • 사용자 수: 332명 이상 등록
  • 구축된 프로젝트 수: 86개
  • 실행된 워크플로우 수: 2,481개 (51,000회 이상의 개별 실행, 357,000회 버전 관리 실행)
  • 배포 사례: 7개의 공개 배포, 최대 100노드/400코어
  • 논문: VLDB 2024 논문에 기술됨 (인용 정보 제공됨)

더 알아보기


Apache Texera는 시각적 워크플로 엔지니어링과 대화형 AI를 결합하여, 전문 프로그래머가 아니어도 고급 데이터 과학 파이프라인에 접근할 수 있도록 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트