SmolLM 출시: 고성능 소형 언어 모델
Hugging Face는 SmolLM을 발표했습니다. SmolLM은 135M, 360M, 1.7B 파라미터의 최첨단 소형 언어 모델(SLM) 패밀리로, 스마트폰 및 노트북과 같은 장치에 로컬 배포가 가능하도록 설계되어 추론 비용을 낮추고 고품질 데이터 큐레이션을 통해 높은 성능을 달성함으로써 사용자 프라이버시를 향상시킵니다.
데이터 큐레이션 및 SmolLM-Corpus
SmolLM의 성능은 SmolLM-Corpus에 의해 구동됩니다. 이는 세 가지 주요 구성 요소로 이루어진 특수 훈련 세트입니다:
- Cosmopedia v2: 교과서, 이야기, 기사 등을 포함한 3,900만 개의 합성 문서(280억 토큰) 컬렉션입니다. 이는 BISAC 도서 분류 시스템의 34,000개 주제를 기반으로 정제된 프롬프트 전략을 사용해 Mixtral-8x7B-Instruct-v0.1으로 생성되었습니다.
- FineWeb-Edu (deduplicated): 교육 품질 분류기를 사용해 FineWeb 데이터셋에서 필터링한 교육용 웹 샘플 2,200억 토큰.
- Python-Edu: The Stack에서 파생된 교육용 Python 샘플 40억 토큰으로, Llama3 기반 교육용 코드 분류기로 필터링되었습니다.
Cosmopedia v2를 사용한 합성 데이터 개선
Cosmopedia v2를 이전 버전보다 개선하기 위해 Hugging Face는 프롬프트 최적화에 집중했습니다. 비지도 클러스터링 대신 BISAC 도서 분류를 활용해 34,000개의 주제를 정의하고, 가장 관련성이 높은 웹 페이지를 시드 샘플로 가져오기 위한 검색 도구를 구현했습니다.
생성 스타일에 대한 연구 결과, 중학생을 대상으로 한 교과서가 대부분의 벤치마크(MMLU 제외)에서 최고의 성능을 보였으며, 이야기는 상식 추론을 향상시켰습니다. 따라서 v2의 최종 구성은 중학교 콘텐츠 40%, 대학 콘텐츠 30%, 혼합 스타일 30%로 이루어집니다.
모델 아키텍처 및 학습
SmolLM 모델은 20% 쿨다운 단계가 포함된 트라페조이드 학습률 스케줄러를 사용해 학습되었습니다. 학습량은 모델 크기에 따라 달라졌습니다:
- 135M 및 360M 모델: 6000억 토큰으로 학습되었습니다.
- 1.7B 모델: 1조 토큰으로 학습되었습니다.
기술 사양
| 모델 크기 | 아키텍처 비고 | 컨텍스트 길이 | 어휘 크기 |
|---|---|---|---|
| 135M | Grouped-Query Attention (GQA), Depth-prioritized | 2048 | 49,152 |
| 360M | Grouped-Query Attention (GQA), Depth-prioritized | 2048 | 49,152 |
| 1.7B | 전통적인 아키텍처 | 2048 | 49,152 |
모든 모델은 임베딩 tying을 사용합니다. 135M 및 360M 모델은 로컬 디바이스 제약을 최적화하기 위해 MobileLLM과 유사한 설계를 따릅니다.
성능 평가
SmolLM 모델은 상식 추론 및 세계 지식 벤치마크에서 여러 경쟁 소형 언어 모델보다 우수한 성능을 보입니다:
- SmolLM-135M은 토큰 수가 적음에도 불구하고 (600B vs 1T) MobileLM-125M보다 우수합니다.
- SmolLM-360M은 Qwen2-500M 및 MobileLM-350M을 포함한 500M 파라미터 이하 모든 모델보다 우수합니다.
- SmolLM-1.7B은 Microsoft의 Phi-1.5, Qwen2-1.5B, MobileLM-1.5B 등 2B 파라미터 이하 모델보다 우수합니다.
코딩 작업에서 SmolLM-1.7B는 HumanEval에서 24의 pass@1 점수를 달성했습니다.
명령 튜닝 및 정렬
명령 튜닝된 버전은 WebInstructSub 데이터셋의 허용적 서브셋과 StarCoder2-Self-OSS-Instruct를 사용해 생성되었습니다. 정렬은 HelpSteer(135M 및 1.7B용)와 argilla/dpo-mix-7k(360M용)를 활용한 Direct Preference Optimization (DPO)으로 추가 개선되었습니다.
로컬 배포 및 하드웨어 요구 사항
SmolLM은 저메모리 환경에 최적화되었습니다. 이 모델은 iPhone(보통 6GB~8GB DRAM) 등 다양한 하드웨어와 호환됩니다. Hugging Face는 transformers 체크포인트와 ONNX 체크포인트를 공개했으며 llama.cpp 호환을 위한 GGUF 버전을 제공할 계획입니다.