apache/texera
Human-AI Collaborative Data Science Using Visual Workflows
Apache Texera – 시각적이고 인간-AI 협업형 데이터 과학 플랫폼
무엇인가요
- 분석가가 웹 기반 시각 편집기를 통해 데이터 분석 파이프라인을 구축, 실행, 조정할 수 있는 오픈소스 Apache Incubating 프로젝트입니다.
- 시스템 내부의 AI 에이전트가 자연어 명령을 이해하므로, 코드를 작성하지 않고도 연산자 추가, 파라미터 변경, 데이터 탐색이 가능합니다.
핵심 기능
| 기능 | 제공되는 기능 |
|---|---|
| 자연어 기반 데이터 과학 | "나이가 30 이상인 행을 필터링"과 같은 명령을 말하거나 입력하면 AI 에이전트가 워크플로우 연산자로 변환합니다. |
| GUI 기반 워크플로우 | Python, Java, SQL 등 노드를 캔버스에 드래그 앤 드롭하여 연결하고, 클릭 한 번으로 실행합니다. |
| 실시간 공동 작업 | 여러 사용자가 동시에 동일한 워크플로우를 편집하며, 상대방의 변경 사항을 실시간으로 확인할 수 있습니다. |
| 인터랙티브 디버깅 | 중간 결과를 검사하고, 실행을 일시정지/재개하며, 실시간으로 파이프라인을 수정할 수 있습니다. |
| 언어 독립적 런타임 | 노드는 Python 또는 Java로 작성 가능하며, 엔진은 둘을 동일하게 처리합니다. |
| 확장 가능한 병렬 엔진 | 백엔드가 코어 또는 클러스터에 작업을 분산하여, 랩톱에서부터 100노드/400코어까지의 대규모 데이터 처리를 가능하게 합니다. |
| 계산과 저장소 분리 | 로컬 파일, 클라우드 객체 스토어 등으로 저장소를 쉽게 교체 가능하며, 계산 계층에 영향을 주지 않아 클라우드 배포를 간소화합니다. |
주요 활용 사례
- 과학자들을 위한 탐색적 데이터 분석: 빠른 시각 피드백을 제공하면서도 고도화된 AI 모델을 호출할 수 있습니다.
- 과학을 위한 AI 파이프라인: 도메인 전문가가 자연어로 기계학습 단계(특징 추출, 모델 학습, 결과 해석)를 안내합니다.
- 팀 분석 프로젝트: 공유되고 버전 관리되는 워크플로우와 실시간 협업이 필요한 경우.
- 데이터 과학 개념 교육: 반복 코드를 숨기고 직관적인 인터페이스로 학습을 지원합니다.
시작하기
- 로컬에서 실행 – 리포지토리 복제 후 Docker-compose 스택 시작 (
docker compose up). 웹 UI는http://localhost:3000에서 접근 가능. - 워크플로우 생성 – Source 노드(CSV, 데이터베이스 등)를 드래그하여 연결하고, 처리 노드(필터, 맵, ML 모델)를 거쳐 Sink (파일, 대시보드)로 마무리.
- AI에 요청 – 채팅형 어시스턴트 패널을 열고 자연어 명령을 입력하면 시스템이 자동으로 노드를 추가하거나 수정합니다.
- 확장 배포 – 대규모 작업의 경우 백엔드를 클라우드 VM 클러스터에 배포하고, 시스템이 사용 가능한 코어에 자동으로 연산자를 분산합니다.
커뮤니티 및 영향력
- 사용자 수: 332명 이상 등록
- 구축된 프로젝트 수: 86개
- 실행된 워크플로우 수: 2,481개 (51,000회 이상의 개별 실행, 357,000회 버전 관리 실행)
- 배포 사례: 7개의 공개 배포, 최대 100노드/400코어
- 논문: VLDB 2024 논문에 기술됨 (인용 정보 제공됨)
더 알아보기
- 공식 사이트: https://texera.apache.org/
- README에서 데모 영상, 블로그 포스트, 문서 링크 제공.
Apache Texera는 시각적 워크플로 엔지니어링과 대화형 AI를 결합하여, 전문 프로그래머가 아니어도 고급 데이터 과학 파이프라인에 접근할 수 있도록 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트