pixeltable/pixeltable

Unified multimodal backend for AI data apps

What it solves

Pixeltable은 멀티모달 AI 애플리케이션 제작을 단순화하고 통합 백엔드를 제공합니다. Blob 스토리지, 벡터 데이터베이스, 오케스트레이터, API 엔드포인트와 같은 개별 컴포넌트를 수동으로 연결할 필요가 없어지며, 이는 일반적으로 복잡한 ETL 스크립트와 별도의 glue 스크립트 유지보수가 필요했습니다.

How it works

Pixeltable은 Python API를 사용해 이미지, 비디오, 오디오, 문서 등 멀티모달 데이터를 관리하고 AI 워크플로를 처리합니다. "계산 열"을 이용해 새로운 행이나 오래된 행에 대해 증분적으로 실행되며, 사용자는 테이블 스키마에 직접 AI 처리 파이프라인(예: 임베딩 또는 LLM 요약)을 정의할 수 있습니다. 또한 미디어를 행으로 "폭발"시키는 내장 이터레이터(예: 문서를 청크로 나누거나 비디오를 프레임으로 분할)를 제공하고, 테이블 데이터와 동기화되는 벡터 검색 인덱스를 통합합니다.

Who it’s for

멀티모달 AI 데이터 앱을 구축하는 개발자, ML 엔지니어(데이터 전처리 담당), 구조화 및 비구조화된 미디어 저장·검색이 필요한 RAG 파이프라인이나 AI 에이전트를 만드는 사람들을 위한 도구입니다.

Highlights

  • Unified Multimodal Interface: 구조화 데이터와 미디어(S3, GCS, Azure 등)를 단일 테이블에 저장.
  • Detailed Iterators: 문서 분할, 비디오 프레임 추출, 오디오 세그멘테이션을 위한 내장 도구.
  • Declarative Orchestration: AI 모델과 처리 단계가 계산 열로 선언되어 캐시와 재시도를 자동으로 처리.
  • Integrated Vector Search: 메타데이터 필터링과 결합된 의미 유사도 검색을 단일 쿼리로 수행.
  • Automatic Serving: TOML 설정 또는 FastAPI를 통해 테이블 스키마에서 직접 REST API 엔드포인트 생성.
  • Version Control: 내장된 타임 트래블 기능으로 수정 사항을 되돌리거나 특정 스냅샷을 쿼리 가능.
  • Agentic Tooling: 툴 호출 및 Model Context Protocol(MCP)을 지원하여 LLM 기반 데이터 작업을 구현.