PatchTSMixer가 Hugging Face Transformers에 추가되었습니다 – 릴리스 및 빠른 시작 가이드
TL;DR
PatchTSMixer는 IBM Research에서 개발한 경량 MLP‑Mixer 기반 시계열 모델로, 이제 Hugging Face Transformers 라이브러리에서 사용할 수 있어 빠르고 메모리 효율적인 예측, 분류 및 회귀를 최첨단 정확도로 수행할 수 있습니다.
PatchTSMixer란?
PatchTSMixer는 다변량 시계열 입력을 고정 크기의 패치로 분할하고, 이를 임베딩한 뒤 MLP‑Mixer 레이어 스택으로 처리하여 패치 간, 패치 내부, 채널 간 상관관계를 학습합니다. 잔차 연결과 게이트형 어텐션 모듈은 모델이 중요한 특징에 집중하도록 돕습니다. 이 아키텍처는 마스크된 사전학습과 직접 예측을 모두 지원하며, 다양한 어텐션 블록으로 구성할 수 있습니다.
성능 주장
원본 IBM Research 논문에 따르면, PatchTSMixer는 기존 MLP 및 Transformer 베이스라인 대비 예측 정확도를 8 %–60 % 향상시키고, 최신 Patch‑Transformer 모델보다 1 %–2 % 더 높은 성능을 보이며, 메모리와 실행 시간은 2 ×–3 × 적게 사용합니다.
시작하기: 설치
PatchTSMixer를 사용하려면 두 개의 Python 패키지가 필요합니다:
pip install git+https://github.com/IBM/tsfm.git # IBM Time Series Foundation Model repository
pip install transformers # Hugging Face Transformers
간단한 확인:
from transformers import PatchTSMixerConfig
from tsfm_public.toolkit.dataset import ForecastDFDataset
임포트가 성공하면 환경이 준비된 것입니다.
예제 1 – 전기 데이터셋에 대한 직접 예측
노트북은 전체 학습 파이프라인을 보여줍니다:
- 시드 설정 –
set_seed(42)를 사용한 재현성. - 데이터 로드 – CSV를 pandas로 읽고, 열을 인덱스 범위에 따라 학습/검증/테스트로 분할합니다.
- 전처리 –
TimeSeriesPreprocessor가 각 윈도우를 스케일링(기본값 "std")하고 길이 512의 슬라이딩 컨텍스트 윈도우를 생성합니다. - 모델 구성 – 예시 하이퍼파라미터:
config = PatchTSMixerConfig( context_length=512, prediction_length=96, patch_length=8, patch_stride=8, num_input_channels=..., d_model=16, num_layers=8, expansion_factor=2, dropout=0.2, head_dropout=0.2, mode="common_channel", scaling="std", ) model = PatchTSMixerForPrediction(config) - 학습 – 조기 종료(patience 10)와 MSE 손실을 사용하는 Hugging Face
Trainer. 샘플 학습 로그는 손실이 0.247에서 ~0.12로 감소함을 보여줍니다. - 평가 – 테스트 MSE 0.128이 전기 벤치마크에서 최첨단으로 보고됩니다.
- 저장 – 모델 체크포인트는
trainer.save_model()를 통해 저장됩니다.
예제 2 – ETTh2에 대한 전이 학습
같은 사전학습 모델을 다른 데이터셋에 재사용할 수 있습니다:
- Zero‑shot – ETTh2에 직접 평가했을 때 MSE 0.304를 얻으며, SOTA와 비슷합니다.
- Linear probing – 백본을 고정하고 선형 헤드만 학습하여 MSE를 0.271로 낮춥니다.
- Full fine‑tuning – 모든 파라미터를 풀어도 MSE가 0.273으로 약간만 개선되며, 이는 사전학습된 특징이 이미 매우 효과적임을 나타냅니다.
세 단계 모두 조정된
TrainingArguments(낮은 학습률, 조기 종료 patience 5)를 사용한 동일한TrainerAPI를 활용합니다.
주요 요점
- PatchTSMixer는 이제 Transformers 라이브러리의 일등 모델로, 기존 HF 파이프라인에의 통합을 간소화합니다.
- MLP‑Mixer 백본은 전통적인 Transformers보다 훨씬 낮은 계산 오버헤드로 강력한 예측 정확도를 제공합니다.
- 모델은 직접 학습과 전이 학습을 모두 지원하여 새로운 시계열 도메인에서 zero‑shot 및 fine‑tuned 성능을 가능하게 합니다.
- 엔드‑투‑엔드 노트북은 데이터 준비, 모델 구성, 학습, 평가 및 체크포인트 저장을 다루며, 실무자를 위한 바로 실행 가능한 레퍼런스를 제공합니다.
리소스
- 원본 논문: TSMixer: Lightweight MLP‑Mixer Model for Multivariate Time Series Forecasting (IBM Research) – https://arxiv.org/pdf/2306.09364.pdf
- Hugging Face 모델 문서: https://huggingface.co/docs/transformers/main/en/model_doc/patchtsmixer
- 전체 노트북: https://colab.research.google.com/github/huggingface/notebooks/blob/main/examples/patch_tsmixer.ipynb
SUMMARY: PatchTSMixer는 IBM Research에서 개발한 경량 MLP‑Mixer 시계열 모델로, 이제 Hugging Face Transformers에 출시되어 훨씬 낮은 메모리와 실행 시간 비용으로 최첨단 예측을 제공합니다.
TITLE: PatchTSMixer가 Hugging Face Transformers에 추가되었습니다 – 릴리스 및 빠른 시작 가이드
Sources
- OriginalPatchTSMixer in HuggingFace