2023년 오픈 LLM 리뷰
TL;DR
2023년은 3B에서 70B 파라미터에 이르는 새로운 모델들이 다수 출시되고, 다양한 파인‑튜닝 방법과 툴링이 등장하면서 LLM이 연구자와 개발자에게 훨씬 더 접근하기 쉬워진 급속한 확장 연도가 되었습니다.
🍜 사전 학습된 LLM 구축 방식
- Architecture – 대부분의 최고 성능 오픈 LLM은 디코더‑전용 Transformer(2017년 논문의 고전적인 "transformer" 설계)를 사용합니다. 변형으로는 ALiBi, RoPE, RMSNorm, SwiGLU, 그리고 Flash‑Attention, GQA, 슬라이딩 윈도우와 같은 어텐션 트윅이 포함됩니다.
- Training dataset – 텍스트 데이터(자연어, 코드, 표, 방정식)는 서브워드 단위로 토크나이즈되며, 어휘는 보통 32k–200k 토큰을 포괄합니다. 최신 데이터셋은 수백 억에서 수조 토큰에 달합니다.
- Tokenizer – 원시 텍스트를 숫자 토큰 ID로 변환합니다; 데이터셋의 토큰 수가 규모를 나타내는 주요 지표입니다.
- Training hyper‑parameters – 학습률, 배치 크기 및 기타 옵티마이저 설정을 정의하여 가중치 업데이트 방식을 제어합니다.
- Compute – 대규모 학습에는 방대한 GPU/TPU 클러스터와 세심한 모니터링이 필요합니다.
- Weights – 학습된 파라미터는 모델 체크포인트로 공개되어 추론 및 downstream 파인‑튜닝에 활용됩니다.
- Fine‑tuning – 오픈 가중치를 통해 특정 작업에 저비용으로 적응할 수 있으며, 처음부터 학습하는 것보다 훨씬 적은 연산량으로 가능합니다.
🗝️ 2022: 규모‑중심에서 데이터‑중심 스케일링으로
- BLOOM (BigScience, 176B 파라미터, 350B 토큰, 다국어) – 오픈이며, 완전 문서화된 데이터 파이프라인을 제공합니다.
- OPT (Meta, 175B 파라미터, 180B 토큰) – GPT‑3 수준의 성능을 연산 효율적인 트릭으로 구현합니다.
- GLM‑130B (Tsinghua/Zhipu.AI, 130B 파라미터, 400B 토큰) – DeepNorm과 로터리 임베딩을 사용해 GPT‑3에 필적합니다.
- Smaller open models – Galactica(최대 120B, 과학 텍스트)와 GPT‑NeoX‑20B(20B, 500B 토큰)는 완전 오픈 스택의 가능성을 보여주었습니다.
- Shift in scaling law – DeepMind의 Chinchilla 논문(70B 파라미터, 1.4T 토큰)은 고정된 연산 예산 하에서 더 많은 데이터로 학습된 작은 모델이 데이터가 부족한 큰 모델보다 우수함을 증명했습니다. 이 통찰은 "더 많은 데이터, 작은 모델"로의 커뮤니티 전반적인 전환을 촉발했습니다.
🌊 2023: 오픈 출시 물결
소형 LLM(3B–70B) 급증
- LLaMA (Meta, Feb) – 65B 파라미터 모델이 1.4T 토큰으로 학습됐으며, 6B/13B 변형은 1T 토큰으로 학습되었습니다; 비상업적 라이선스.
- Pythia (EleutherAI, Apr) – 완전 공개된 데이터로 학습된 스케일링 스위트.
- MPT (MosaicML, May) – 7B와 30B 모델, 상업 친화적 라이선스, 영어+코드 1T 토큰으로 학습.
- Falcon (TII‑UAE, Jun) – 7B/30B(후에 180B) 모델, 1–1.5T 토큰, 상세 기술 보고서.
- StableLM (StabilityAI, Apr & Aug) – 3B/7B 기본 모델(1.5T 토큰)과 이후 v2 시리즈(혼합 데이터 소스).
- X‑Gen (Salesforce, Jun) – 7B 모델, 1.5T 토큰, 단계적 데이터 스케줄링.
- LLaMA‑2 (Meta, Jul) – 7–70B 모델, 2T 토큰, 관용적인 커뮤니티 라이선스, 광범위한 RLHF 정렬.
- Mistral‑7B (Mistral.AI, Sep) – 비공개 웹 데이터로 학습; 이후 Mixtral‑8×7B는 MoE 라우팅을 도입.
- Qwen (Alibaba, Sep) – 7–70B 모델, 2.4T 토큰, 영어‑중국어 이중 언어 초점.
- Yi (01‑AI, Nov) – 6–34B 모델, 3T 토큰, 리더보드에서 강력한 성능.
- DeciLM, SOLAR 등 (Deci, Upstage 등) – 7–10B 규모에서 지속적인 점진적 개선.
이 모든 출시의 공통점:
- 디코더‑전용 Transformer 코어.
- 다양한 아키텍처 트윅(ALiBi, RoPE, RMSNorm, SwiGLU, Flash‑Attention, GQA, 슬라이딩 윈도우).
- 비상업적부터 완전 관용적까지 다양한 라이선스 하에 공개된 가중치.
- Chinchilla 통찰을 반영해 대규모 토큰 수로 학습된 소형 모델 강조.
대화형 모델이 everywhere
- Chat‑based fine‑tuning – 다중 턴 대화 데이터를 사용한 감독 학습.
- Instruction fine‑tuning (IFT) – 명령‑응답 쌍을 사용하며, 종종 합성(GPT‑4 생성) 데이터가 활용됩니다.
- RLHF – 인간이 순위 매긴 응답으로 선호 모델을 학습하고, 이를 강화 학습에 활용합니다; 비용이 많이 들지만 안전성을 향상시킵니다.
- RLAIF – 인간 순위자를 고품질 LLM으로 대체해 선호 점수를 매깁니다.
- Direct Preference Optimization (DPO) – 별도의 선호 모델 없이 순위 데이터를 직접 모델에 적용해 업데이트합니다.
2023년 대부분의 출시 모델은 기본 체크포인트와 챗‑튜닝 변형(예: LLaMA‑2‑Chat, Falcon‑Instruct, MPT‑Chat, Qwen‑Chat, Yi‑Chat)을 모두 제공했습니다. 특히 LLaMA‑2의 안전‑중심 정렬이 눈에 띄었습니다.
커뮤니티 활동
- 방대한 인스트럭션·챗 데이터셋 확산: WebGPT, HH‑RLHF, P3, FLAN, Self‑Instruct, HC3, Alpaca, OIG, Vicuna, UltraChat, Open‑Orca, UltraFeedback, Zephyr, OpenHermes, Starling, Nectar 등.
- 커뮤니티 파인‑튜닝(Alpaca, Koala, Dolly, UltraLLaMA, Hermes, Capybara, OpenChat 등)은 기본 모델 위에 구축되며, 종종 RLHF, DPO, RLAIF를 활용합니다.
- 이 생태계는 선순환을 형성합니다: 고품질 기본 모델 → 새로운 데이터셋 → 더 강력한 파인‑튜닝 모델.
Democratizing access
Model merging (extreme customization)
- 여러 호환 모델의 가중치를 평균 혹은 가중 평균으로 병합하고, 때때로 간섭‑인식 기법(예: ties merging)을 적용합니다. 이를 통해
llama2‑zephyr‑orca‑ultra와 같이 여러 체크포인트의 장점을 결합한 하이브리드 모델을 만들 수 있습니다.
Parameter‑efficient fine‑tuning (PEFT)
- 기본 모델을 고정하고 경량 어댑터(예: LoRA, IA³)를 학습합니다. 어댑터 가중치만 저장·공유하면 되므로 저장 용량과 연산 요구량이 크게 감소합니다.
Quantization (running everywhere)
- 수치 정밀도를 낮추면(float32 → float16 → int8 → 4‑bit) 메모리 사용량이 크게 줄어듭니다. 예를 들어 30B 모델은 ~66 GB(float16)에서 ~33 GB(8‑bit) 혹은 ~16 GB(4‑bit)로 감소하며, 대형 모델에서도 성능 손실은 최소화됩니다.
- 인기 툴킷: bitsandbytes, GPTQ, AWQ; 커뮤니티 변환기(예: TheBloke)가 양자화 체크포인트를 널리 제공합니다.
What’s next?
- Mixture‑of‑Experts (MoE) – Mixtral‑8×7B는 각 토큰을 8개의 서브‑모델 중 2개에 라우팅해 파라미터 수는 늘리면서 연산량은 비례적으로 증가하지 않게 합니다.
- State‑space models – Mamba와 Striped Hyena는 특정 작업에서 Transformer를 능가할 수 있는 SSM 아키텍처를 도입했으며, 연구는 아직 초기 단계입니다.
Takeaways
- 2023년 오픈 LLM 출시가 폭발적으로 증가해 학계·산업·취미 커뮤니티 전반에 걸친 빠른 실험을 가능하게 했습니다.
- Chinchilla 스케일링 통찰 이후 "더 큰 것이 아니라 더 작은, 데이터가 풍부한 모델"로 흐름이 전환되었습니다.
- 새로운 파인‑튜닝 패러다임(RLHF, DPO, 어댑터, 병합)은 개인화 옵션을 크게 확대했습니다.
- 양자화와 PEFT는 하드웨어 장벽을 낮춰 소비자 급 GPU에서도 모델 실행이 가능하도록 했습니다.
- 중국 기업(Qwen, Yi)과 새로운 아키텍처(MoE, SSM)의 등장으로 오픈소스 LLM 풍경은 앞으로도 치열한 경쟁을 이어갈 전망입니다.
Sources
- Original2023, year of open LLMs