2023 年開源大型語言模型回顧
TL;DR
2023 年標誌著開源大型語言模型(LLM)的快速擴張,眾多新發布的模型規模從 3B 到 70B 參數不等,涵蓋廣泛的微調方法與工具,使 LLM 更加易於研究人員與開發者使用。
🍜 預訓練 LLM 的建構方式
- Architecture – 大多數表現最佳的開源 LLM 採用僅解碼器的 Transformer(即 2017 年論文中提出的經典「transformer」設計)。變體包括 ALiBi、RoPE、RMSNorm、SwiGLU,以及注意力機制的調整,如 Flash‑Attention、GQA 或滑動窗口。
- Training dataset – 文本資料(自然語言、程式碼、表格、方程式)會被切分成子詞單位;詞彙表通常包含 32k–200k 個 token。現代資料集的 token 數量從數千億到數兆不等。
- Tokenizer – 將原始文字轉換為數值 token ID;資料集的 token 數量是衡量規模的主要指標。
- Training hyper‑parameters – 定義學習率、批次大小以及其他優化器設定,以控制權重的更新方式。
- Compute – 大規模訓練需要龐大的 GPU/TPU 叢集,並需仔細監控。
- Weights – 最終學得的參數會以模型檢查點的形式釋出,供推論與後續微調使用。
- Fine‑tuning – 開放的權重使得針對特定任務的適應成本低廉,通常所需計算遠低於從頭訓練。
🗝️ 2022:從規模驅動到資料驅動的擴展
- BLOOM(BigScience,176B 參數,350B token,多語言)– 開放且完整記錄的資料管線。
- OPT(Meta,175B 參數,180B token)– 具備 GPT‑3 水準的效能,並採用計算效能的技巧。
- GLM‑130B(清華/智譜 AI,130B 參數,400B token)– 與 GPT‑3 相當,使用 DeepNorm 與 rotary embedding。
- Smaller open models – Galactica(最高 120B,科學文本)與 GPT‑NeoX‑20B(20B,500B token)展示了完整開源堆疊的可行性。
- Shift in scaling law – DeepMind 的 Chinchilla 論文(70B 參數,1.4T token)指出,在固定計算預算下,使用更多資料訓練的較小模型優於資料匱乏的較大模型。此見解促使社群普遍轉向「更多資料、較小模型」的方向。
🌊 2023:開源發布的浪潮
小型 LLM 的崛起(3B–70B)
- LLaMA(Meta,2 月) – 65B 參數模型,使用 1.4T token 訓練;6B/13B 變體使用 1T token 訓練;非商業授權。
- Pythia(EleutherAI,4 月) – 以完全公開的資料訓練的可擴展模型套件。
- MPT(MosaicML,5 月) – 7B 與 30B 模型,商業友好授權,使用 1T token 的英文與程式碼訓練。
- Falcon(TII‑UAE,6 月) – 7B/30B(後續 180B)模型,使用 1–1.5T token,附有詳細技術報告。
- StableLM(StabilityAI,4 月與 8 月) – 3B/7B 基礎模型(1.5T token),之後的 v2 系列使用混合資料來源。
- X‑Gen(Salesforce,6 月) – 7B 模型,1.5T token,分階段資料排程。
- LLaMA‑2(Meta,7 月) – 7–70B 模型,2T token,寬鬆的社群授權,廣泛的 RLHF 對齊。
- Mistral‑7B(Mistral.AI,9 月) – 使用未公開的網路資料訓練;之後的 Mixtral‑8×7B 引入 MoE 路由。
- Qwen(阿里巴巴,9 月) – 7–70B 模型,2.4T token,聚焦英中雙語。
- Yi(01‑AI,11 月) – 6–34B 模型,3T token,於排行榜上表現優異。
- DeciLM、SOLAR 等(Deci、Upstage 等) – 在 7–10B 規模上持續進行漸進式改進。
所有這些發布都有以下共通點:
- 僅解碼器的 Transformer 核心。
- 各種架構調整(ALiBi、RoPE、RMSNorm、SwiGLU、Flash‑Attention、GQA、滑動窗口)。
- 開放權重,授權類型多樣,從非商業到完全寬鬆。
- 強調在大量 token 上訓練較小模型,呼應 Chinchilla 的洞見。
對話模型無處不在
- Chat‑based fine‑tuning – 在多輪對話資料上進行監督式訓練。
- Instruction fine‑tuning (IFT) – 使用指令‑回應對,常為合成資料(例如 GPT‑4 產生)。
- RLHF – 透過人類排序的回應訓練偏好模型,進而指導強化學習;成本高但提升安全性。
- RLAIF – 用高品質 LLM 取代人類排序者進行偏好評分。
- Direct Preference Optimization (DPO) – 直接根據排序資料更新模型,省去獨立的偏好模型。
大多數 2023 年的發布同時提供基礎檢查點與聊天微調變體(例如 LLaMA‑2‑Chat、Falcon‑Instruct、MPT‑Chat、Qwen‑Chat、Yi‑Chat)。LLaMA‑2 以安全為導向的對齊尤為顯著。
社群活動
- 指令與聊天資料集的大量激增:WebGPT、HH‑RLHF、P3、FLAN、Self‑Instruct、HC3、Alpaca、OIG、Vicuna、UltraChat、Open‑Orca、UltraFeedback、Zephyr、OpenHermes、Starling、Nectar 等。
- 社群微調模型(Alpaca、Koala、Dolly、UltraLLaMA、Hermes、Capybara、OpenChat 等)基於基礎模型構建,常結合 RLHF、DPO 或 RLAIF。
- 生態系統形成良性循環:高品質的基礎模型促成新資料集的產生,進而產出更強大的微調模型。
民主化存取
模型合併(極致客製化)
- 合併(平均或加權平均)多個相容模型的權重,有時會使用干擾感知技術(例如 ties merging)。此方式可產生如
llama2‑zephyr‑orca‑ultra的混合模型,結合多個檢查點的優勢。
參數效率微調(PEFT)
- 冻結基礎模型,僅訓練輕量的適配器(例如 LoRA、IA³)。只需保存與分享適配器權重,顯著降低儲存與計算需求。
量化(隨處可跑)
- 降低數值精度(float32 → float16 → int8 → 4‑bit)可減少記憶體佔用:30B 模型的記憶體需求從約 66 GB(float16)降至約 33 GB(8‑bit)或約 16 GB(4‑bit),且在大型模型上性能損失極小。
- 常用工具套件:bitsandbytes、GPTQ、AWQ;社群轉換工具(例如 TheBloke)使量化檢查點廣為可得。
未來展望
- Mixture‑of‑Experts (MoE) – Mixtral‑8×7B 會將每個 token 送入八個子模型中的兩個,提升參數量卻不成比例增加計算量。
- State‑space models – Mamba 與 Striped Hyena 引入 SSM 架構,可能在特定任務上超越 Transformer;相關研究仍處於早期階段。
重點回顧
- 2023 年開源 LLM 的發布激增,使學術、產業與業餘社群能快速進行實驗。
- 在 Chinchilla 的擴展洞見之後,趨勢從「越大越好」轉向「較小、資料豐富的模型」。
- 新的微調範式(RLHF、DPO、適配器、合併)大幅擴展了個人化的可能性。
- 量化與 PEFT 降低了硬體門檻,使模型能在消費級 GPU 上運行。
- 來自中國的新興參與者(Qwen、Yi)以及新架構(MoE、SSM)顯示開源 LLM 生態將持續高度競爭。
Sources
- Original2023, year of open LLMs