SmolVLM 256M 및 500M 릴리스 노트

Hugging Face는 제약된 장치, 소비자용 노트북 및 브라우저 기반 추론을 위해 설계된 두 가지 새로운 경량 Vision Language Model(VLM)인 SmolVLM-256MSmolVLM-500M을 출시했습니다. 256M 모델은 현재 세계에서 가장 작은 VLM이지만, 17개월 전에 출시된 Idefics 80B 모델보다 뛰어난 성능을 보여줍니다.

모델 변체 및 기능

두 가지 모델 크기가 제공되며, 각각 베이스 모델과 인스트럭션 미세 조정(instruction fine-tuned) 버전으로 제공됩니다:

  • SmolVLM-256M: 사용 가능한 가장 작은 VLM으로, 이미지 및 짧은 비디오 캡셔닝, 문서 Q&A(PDF 및 스캔된 텍스트), 차트 및 다이어그램을 포함한 기본적인 시각적 추론이 가능합니다.
  • SmolVLM-500M: 5억 개의 파라미터를 가진 모델로, 더 높은 성능 여유와 프롬프팅에 대한 더 큰 견고성을 제공하여 즉각적인 프로덕션 사용에 더 적합합니다. MMMU 및 DocVQA 성능을 더 큰 모델에 가깝게 끌어올렸습니다.

SmolVLM 2B 대비 기술적 개선 사항

Hugging Face는 멀티모달 성능을 유지하면서 크기를 줄이기 위해 몇 가지 설계 트레이드오프와 최적화를 구현했습니다:

Vision Encoder 최적화

SmolVLM 2B에서 사용된 SigLIP 400M SO 인코더 대신, 이 모델들은 **SigLIP base patch-16/512 (93M parameters)**를 사용합니다. 테스트 결과 더 큰 인코더가 제공하는 이득은 미미한 것으로 나타났습니다. 더 작은 인코더는 또한 더 큰 해상도로 이미지를 처리하여 최소한의 오버헤드로 시각적 이해도를 향상시킵니다.

데이터 믹스 업데이트

학습 데이터는 The Cauldron과 Docmatix에서 가져왔으며, MathWriting이 추가되었습니다. 데이터 비율은 다음과 같은 항목을 강조하도록 조정되었습니다:

  • 문서 이해 (Document Understanding): 41%
  • 이미지 캡셔닝 (Image Captioning): 14%

토큰화(Tokenization) 강화

효율성을 높이기 위해 모델은 이제 2B 버전의 토큰당 1820 픽셀에서 토큰당 4096 픽셀의 비율로 이미지를 인코딩합니다. 또한, 서브 이미지 구분자를 위한 멀티 토큰 문자열을 대체하기 위해 특수 토큰이 도입되었습니다 (예: <row_1_col_1>부터 <row_6_col_6>까지를 단일 토큰으로 매핑). 이는 학습 안정성과 결과 품질을 향상시켰습니다.

생태계 및 통합

ColSmolVLM을 통한 멀티모달 검색

ColBERT 스타일의 검색 아키텍처를 사용하여 팀은 ColSmolVLM 256M 및 500M을 개발했습니다. 이 모델들은 크기가 10배 더 큰 모델에 필적하는 성능과 함께 최첨단 멀티모달 검색 속도를 제공하여, 검색 가능한 데이터베이스를 구축하는 데 필요한 비용과 시간을 줄여줍니다.

SmolDocling을 통한 문서 처리

IBM과의 파트너십을 통해 Hugging Face는 이 모델들을 Docling에 통합하고 있습니다. 초기 결과에 따르면 256M 모델은 문서 레이아웃 및 표 이해에 매우 효과적입니다.

배포 및 프레임워크 지원

SmolVLM-256M 및 500M은 기존 SmolVLM 코드와 호환되며 다음 프레임워크를 지원합니다:

  • Transformers: 추론 및 미세 조정을 위한 직접 로드 지원.
  • MLX: Apple Silicon에 최적화.
  • ONNX: WebGPU 데모 및 브라우저 기반 추론을 위한 체크포인트 제공.
  • TRL: 정렬(alignment) 및 Direct Preference Optimization (DPO) 지원.

Sources