SmolVLA: Lerobot 커뮤니티 데이터로 학습된 효율적인 Vision-Language-Action 모델
Hugging Face는 로봇공학을 위해 설계된 SmolVLA라는 450M 파라미터의 소형 오픈소스 Vision-Language-Action (VLA) 모델을 출시했습니다. SmolVLA는 소비자 등급 하드웨어에서 고성능 로봇 제어를 가능하게 하며, 시뮬레이션 환경(LIBERO, Meta-World)과 SO100 및 SO101 팔과 같은 저렴한 하드웨어를 사용한 실제 작업 모두에서 더 큰 VLA 모델 및 ACT와 같은 베이스라인보다 뛰어난 성능을 보입니다.
모델 아키텍처 및 설계
SmolVLA는 인지를 위한 Vision-Language Model (VLM)과 제어를 위한 특화된 액션 전문가를 결합한 모듈식 아키텍처를 활용합니다.
Vision-Language Model (VLM) 백본
SmolVLA는 백본으로 SmolVLM2를 사용하며, 이는 SigLIP 비전 인코더와 SmolLM2 언어 디코더로 구성됩니다. 모델은 다중모달 입력을 다음과 같이 처리합니다:
- Images: 비전 인코더를 통해 추출됩니다.
- Language Instructions: 토큰화되어 디코더에 입력됩니다.
- Sensorimotor States: 선형 레이어를 통해 단일 토큰으로 투영되어 언어 모델 차원에 맞춰집니다.
액션 전문가: Flow Matching Transformer
액션 전문가는 약 100M 파라미터의 소형 트랜스포머로, 미래 로봇 행동 시퀀스(액션 청크)를 생성합니다. 이는 flow matching objective를 사용해 학습되며, 노이즈가 섞인 샘플을 실제 궤적으로 되돌리는 "보정 벡터"를 예측합니다. 이 접근법은 연속적인 행동을 직접적이고 비자동회귀 방식으로 예측하게 하여, 자동회귀 디코딩에 따른 지연 없이 실시간 제어와 높은 정밀도를 보장합니다.
효율성 최적화
낮은 지연 시간과 작은 메모리 사용량을 유지하기 위해 SmolVLA는 세 가지 구체적인 아키텍처 선택을 구현합니다:
- Visual Token Reduction: 이미지(예: 512×512)를 PixelShuffle을 사용해 1024가 아닌 64 토큰으로 압축하여 추론 시간을 크게 단축합니다.
- Layer Skipping: 액션 전문가는 전체 레이어의 절반까지만 VLM 특징에 주목합니다. 이는 VLM과 액션 전문가 모두의 연산 비용을 절반으로 줄이며 성능 손실은 최소화합니다.
- Interleaved Attention: 액션 전문가는 교차 주의(인식 및 명령에 기반한 행동 조건화)와 자체 주의(시간적 부드러움 보장 및 진동 감소)를 번갈아 적용합니다.
비동기 추론 스택
SmolVLA는 액션 실행과 청크 예측을 분리하는 비동기 추론 스택을 도입하여 실행 지연을 없앱니다.
동기 설정에서는 로봇이 현재 청크를 실행한 후 다음 액션 청크를 계산하기 위해 일시 정지합니다. 비동기 설정에서는 로봇이 현재 청크를 실행하면서 최신 관측을 정책 서버(예: GPU에 호스팅될 수 있음)로 전송합니다.
핵심 메커니즘은 다음과 같습니다:
- Early Trigger: 큐 길이가 임계값(예: 70%) 이하로 떨어지면 새로운 관측을 서버에 전송합니다.
- Decoupled Threads: 추론이 제어 루프와 병렬로 수행됩니다.
- Chunk Fusion: 연속 청크에서 겹치는 행동을 병합하여 진동을 방지합니다.
이 시스템은 동기식 추론에 비해 30% 빠른 작업 완료(9.7초 vs 13.75초)와 2배 높은 작업 처리량(고정 시간 내 19개 vs 9개의 큐브 완료)을 달성하면서도 유사한 성공률(~78%)을 유지합니다.
커뮤니티 데이터셋을 활용한 학습
SmolVLA는 Hugging Face Hub의 LeRobot 커뮤니티에서 선별된 487개의 고품질 데이터셋을 사전 학습했으며, 총 1천만 프레임 정도에 해당합니다. 이는 일반적인 벤치마크 데이터셋보다 한 차원 작지만, 행동, 카메라 시점, 구현 형태의 다양성을 크게 제공합니다.
데이터 표준화
분산된 커뮤니티 데이터를 다루기 위해 Hugging Face는 두 가지 표준화 과정을 적용했습니다:
- Task Annotation Improvement: Qwen2.5-VL-3B-Instruct를 사용해 모호한 라벨(예: "Move")을 동사로 시작하고 30자 이하의 간결한 행동 지향 설명으로 재작성했습니다(예: "Pick up the cube").
- Camera View Standardization: 일관되지 않은 카메라 라벨을 표준 스키마로 매핑했습니다:
OBS_IMAGE_1(탑다운),OBS_IMAGE_2(손목 장착),OBS_IMAGE_3+(추가 뷰).
사전 학습의 영향
커뮤니티 데이터에 대한 사전 학습은 성능을 크게 향상시킵니다. SO100 팔에서 성공률이 51.7%(사전 학습 없음)에서 78.3%(사전 학습 후)로 상승했으며, 이는 +26.6% 절대적 향상에 해당합니다.
성능 결과
SmolVLA는 여러 벤치마크에서 강력한 일반화와 효율성을 보여줍니다:
- Simulation: LIBERO와 Meta-World에서 더 큰 VLA와 베이스라인을 능가합니다.
- Real-World (SO100): 픽-플레이스, 스태킹, 정렬 작업에서 베이스라인과 동등하거나 능가합니다.
- Generalization (SO101): ACT 베이스라인에 비해 새로운 구현 형태에 대한 일반화 능력이 뛰어납니다.
- Hardware Accessibility: 모델이 충분히 작아 CPU, MacBook, 혹은 단일 소비자용 GPU에서도 실행할 수 있습니다.