NVIDIA Kumo Tabular 출시로 표 형식 벤치마크에서 최고의 정확도-효율성 달성

TL;DR

NVIDIA Kumo Tabular은 라벨을 미세 조정 없이 단일 전방 전파에서 예측할 수 있는 오픈소스 표 형식 기반 모델이며, TabArena, BeyondArena, TALENT, ScoringBench 벤치마크에서 1위를 기록하여 새로운 정확도-효율성 경계를 설정했습니다.


표 형식 기반 모델로의 전환

표 형식 데이터는 대부분의 기업용 머신러닝 워크로드를 뒷받침하지만, 기존 파이프라인은 각 새로운 작업마다 맞춤형 특성 공학, 하이퍼파라미터 탐색 및 전체 재학습이 필요한 경사 하강 트리에 의존하고 있습니다. 대규모 언어 모델의 '문맥 내 학습'을 영감으로 삼아 Kumo Tabular은 라벨이 지정된 표를 프롬프트로 간주하고, 새로운 행에 대한 라벨을 직접 예측함으로써 가중치 업데이트가 필요 없게 합니다.

"라벨이 지정된 행과 예측이 필요한 행이 포함된 표가 주어졌을 때, Kumo Tabular은 단일 전방 전파에서 클래스 확률 또는 수치 예측을 반환합니다." – NVIDIA Kumo Tabular 발표

Kumo Tabular의 작동 방식

Kumo Tabular은 세 가지 핵심 메커니즘을 사용하여 Transformer 아키텍처를 표의 내재적 구조에 적응시킵니다:

  1. 셀 임베딩 – 수치 및 범주형 값은 학습된 주파수의 사인/코사인(푸리에 특징)으로 변환됩니다. 누락된 값은 전용 토큰을 받으며, 각 문맥 셀은 라벨 임베딩과 쌍을 이룹니다.
  2. 행 임베딩 – 두 가지 교대되는 어텐션 레이어는 열 기반 분포(열 어텐션)와 행 내 특성 상호작용(행 어텐션)을 캡처합니다. 행당 네 개의 학습 가능한 [CLS] 토큰이 최종 행 표현을 담당합니다.
  3. 문맥 내 학습 – 상위 수준의 Transformer는 행 임베딩을 처리합니다: 문맥 행은 서로 어텐션을 주고받으며, 쿼리 행은 문맥에만 어텐션을 줍니다. 테스트-GQA 캐싱은 각 쿼리에 필요한 계산을 줄입니다. 출력 헤드는 분류 작업에 대해 클래스 확률을, 회귀 작업에 대해 999개의 분위수를 생성하여 점 추정과 불확실성 추정을 제공합니다.

길이 인식 어텐션 온도

표의 크기가 커짐에 따라 어텐션을 날카롭게 유지하기 위해 Kumo Tabular은 키의 수의 로그에 따라 소프트맥스 온도를 조정하며, 헤드별로 학습 가능한 계수를 사용합니다. 이는 사전 훈련 중에 보지 못한 수십만 배 더 큰 표에서도 구분 능력을 유지합니다.

인공 표에서의 사전 훈련

Kumo Tabular은 구조적 인과 모델(SCM)에서 생성된 합성 표에만 훈련됩니다:

  • 무작위 인과 그래프는 숨겨진 변수와 타겟 관계를 정의합니다.
  • 노드는 다양한 함수(선형 변환, 소규모 신경망, 트리, 가우시안 프로세스)를 통해 수치 또는 범주형 열로 생성됩니다.
  • 후처리 단계에서 현실적인 결함이 추가됩니다—누락 패턴, 고정된 특성, 무거운 꼬리 타겟, 고카디널리티 범주.
  • 학습 가능한 신호가 없는 표는 빠른 트리 앙상블 검사로 필터링됩니다.

훈련은 세 단계로 진행되며, 문맥 크기를 1,024행(단계 1)에서 최대 60,000행(단계 3)으로 확장하면서 열 수는 ≤100을 유지합니다. 세 가지 모델 크기—작은 모델(28M), 중간 모델(≈100M), 큰 모델(215M)은 각각 약 35M, 71M, 137M개의 합성 표를 훈련했습니다.

벤치마크 성능

일관된 RTX 6000 Pro 환경에서 평가된 Kumo Tabular의 세 가지 변형은 기존 표 형식 기반 모델과 튜닝된 경사 하강 트리보다 네 가지 주요 리더보드에서 모두 우수한 성능을 보였습니다:

  • TabArena – 최고의 전체 ELO(1950)를 기록하며, 이전 최고 성능인 LimiX-2보다 17배 빠릅니다.
  • BeyondArena – ELO 1418과 Improvability 점수 7.78%로 1위를 차지했습니다.
  • TALENT – 분류 정확도(6.67), 분류 로그 손실(3.98), 회귀 RMSE(4.22)에서 평균 순위 1위를 기록했습니다.
  • ScoringBench – Kumo Tabular-Large와 Medium이 평균 예측 분포 순위에서 각각 1위와 2위를 차지했습니다.

이 결과는 Kumo Tabular이 새로운 정확도-효율성 파레토 경계에 위치함을 보여주며, 첨부된 벤치마크 플롯에서 확인할 수 있습니다.

제한 사항

  • 수치 및 범주형 열만 지원합니다. 텍스트, 이미지, 타임스탬프와 같은 다른 모달리티는 사전에 특성으로 변환되어야 합니다.
  • 단일 전방 전파 추론은 최대 10개의 클래스를 직접 처리할 수 있으며, 더 큰 라벨 공간은 라이브러리에서 제공하는 오류 수정 출력 코드를 필요로 합니다.
  • 훈련 범위를 초과하거나 쿼리 행이 문맥 행과 다른 분포에서 올 경우 정확도가 저하될 수 있습니다. 배포 전에 보류된 데이터에서 검증하는 것이 필수적입니다.

빠른 데모

NVIDIA의 structured-data-models 라이브러리는 GPU 네이티브 인터페이스를 제공합니다. 다음 파이썬 스크립트는 pandas.DataFrame을 TableTensor로 변환하고, 라벨이 있는 문맥 행을 제공한 후 라벨이 누락된 행에 대한 예측을 얻습니다:

import sdm  # structured-data-models
import pandas as pd

# CSV를 DataFrame으로 로드하고 GPU에 텐서화
table = sdm.TableTensor.from_pandas(pd.read_csv('data.csv'), device='cuda')
na_mask = table['target'].isnan()

model = sdm.models.KumoTabular(device='cuda')
pred = model(
    x_context=table[~na_mask].drop_columns('target'),
    y_context=table[~na_mask, 'target'],
    x_query=table[na_mask].drop_column('target'),
)

라이브러리는 처음 사용 시 Hugging Face Hub에서 사전 훈련된 가중치를 자동으로 다운로드하고 전처리, 앙상블, 다중 클래스 확장을 처리합니다.

시작하기

Kumo Tabular은 OpenMDW-1.1 라이선스 하에 공개되어 상업적 사용이 허용됩니다. 개발자는 NVIDIA의 신뢰할 수 있는 AI 정책을 따르고, 도메인 특화 데이터에서 모델 성능을 검증하며, 품질, 위험, 보안 관련 문제는 GitHub 이슈 트래커를 통해 보고해야 합니다.


감사의 말

저자들은 중요한 아이디어와 분석을 제공한 David Holzmüller에게, 그리고 인턴십 기여를 한 Vignesh Kothapalli에게 감사를 표합니다.

Sources