2023 年開源大型語言模型回顧

TL;DR

2023 年標誌著開源大型語言模型(LLM)的快速擴張,眾多新發布的模型規模從 3B 到 70B 參數不等,涵蓋廣泛的微調方法與工具,使 LLM 更加易於研究人員與開發者使用。


🍜 預訓練 LLM 的建構方式

  • Architecture – 大多數表現最佳的開源 LLM 採用僅解碼器的 Transformer(即 2017 年論文中提出的經典「transformer」設計)。變體包括 ALiBi、RoPE、RMSNorm、SwiGLU,以及注意力機制的調整,如 Flash‑Attention、GQA 或滑動窗口。
  • Training dataset – 文本資料(自然語言、程式碼、表格、方程式)會被切分成子詞單位;詞彙表通常包含 32k–200k 個 token。現代資料集的 token 數量從數千億到數兆不等。
  • Tokenizer – 將原始文字轉換為數值 token ID;資料集的 token 數量是衡量規模的主要指標。
  • Training hyper‑parameters – 定義學習率、批次大小以及其他優化器設定,以控制權重的更新方式。
  • Compute – 大規模訓練需要龐大的 GPU/TPU 叢集,並需仔細監控。
  • Weights – 最終學得的參數會以模型檢查點的形式釋出,供推論與後續微調使用。
  • Fine‑tuning – 開放的權重使得針對特定任務的適應成本低廉,通常所需計算遠低於從頭訓練。

🗝️ 2022:從規模驅動到資料驅動的擴展

  • BLOOM(BigScience,176B 參數,350B token,多語言)– 開放且完整記錄的資料管線。
  • OPT(Meta,175B 參數,180B token)– 具備 GPT‑3 水準的效能,並採用計算效能的技巧。
  • GLM‑130B(清華/智譜 AI,130B 參數,400B token)– 與 GPT‑3 相當,使用 DeepNorm 與 rotary embedding。
  • Smaller open models – Galactica(最高 120B,科學文本)與 GPT‑NeoX‑20B(20B,500B token)展示了完整開源堆疊的可行性。
  • Shift in scaling law – DeepMind 的 Chinchilla 論文(70B 參數,1.4T token)指出,在固定計算預算下,使用更多資料訓練的較小模型優於資料匱乏的較大模型。此見解促使社群普遍轉向「更多資料、較小模型」的方向。

🌊 2023:開源發布的浪潮

小型 LLM 的崛起(3B–70B)

  • LLaMA(Meta,2 月) – 65B 參數模型,使用 1.4T token 訓練;6B/13B 變體使用 1T token 訓練;非商業授權。
  • Pythia(EleutherAI,4 月) – 以完全公開的資料訓練的可擴展模型套件。
  • MPT(MosaicML,5 月) – 7B 與 30B 模型,商業友好授權,使用 1T token 的英文與程式碼訓練。
  • Falcon(TII‑UAE,6 月) – 7B/30B(後續 180B)模型,使用 1–1.5T token,附有詳細技術報告。
  • StableLM(StabilityAI,4 月與 8 月) – 3B/7B 基礎模型(1.5T token),之後的 v2 系列使用混合資料來源。
  • X‑Gen(Salesforce,6 月) – 7B 模型,1.5T token,分階段資料排程。
  • LLaMA‑2(Meta,7 月) – 7–70B 模型,2T token,寬鬆的社群授權,廣泛的 RLHF 對齊。
  • Mistral‑7B(Mistral.AI,9 月) – 使用未公開的網路資料訓練;之後的 Mixtral‑8×7B 引入 MoE 路由。
  • Qwen(阿里巴巴,9 月) – 7–70B 模型,2.4T token,聚焦英中雙語。
  • Yi(01‑AI,11 月) – 6–34B 模型,3T token,於排行榜上表現優異。
  • DeciLM、SOLAR 等(Deci、Upstage 等) – 在 7–10B 規模上持續進行漸進式改進。

所有這些發布都有以下共通點:

  • 僅解碼器的 Transformer 核心。
  • 各種架構調整(ALiBi、RoPE、RMSNorm、SwiGLU、Flash‑Attention、GQA、滑動窗口)。
  • 開放權重,授權類型多樣,從非商業到完全寬鬆。
  • 強調在大量 token 上訓練較小模型,呼應 Chinchilla 的洞見。

對話模型無處不在

  • Chat‑based fine‑tuning – 在多輪對話資料上進行監督式訓練。
  • Instruction fine‑tuning (IFT) – 使用指令‑回應對,常為合成資料(例如 GPT‑4 產生)。
  • RLHF – 透過人類排序的回應訓練偏好模型,進而指導強化學習;成本高但提升安全性。
  • RLAIF – 用高品質 LLM 取代人類排序者進行偏好評分。
  • Direct Preference Optimization (DPO) – 直接根據排序資料更新模型,省去獨立的偏好模型。

大多數 2023 年的發布同時提供基礎檢查點與聊天微調變體(例如 LLaMA‑2‑Chat、Falcon‑Instruct、MPT‑Chat、Qwen‑Chat、Yi‑Chat)。LLaMA‑2 以安全為導向的對齊尤為顯著。

社群活動

  • 指令與聊天資料集的大量激增:WebGPT、HH‑RLHF、P3、FLAN、Self‑Instruct、HC3、Alpaca、OIG、Vicuna、UltraChat、Open‑Orca、UltraFeedback、Zephyr、OpenHermes、Starling、Nectar 等。
  • 社群微調模型(Alpaca、Koala、Dolly、UltraLLaMA、Hermes、Capybara、OpenChat 等)基於基礎模型構建,常結合 RLHF、DPO 或 RLAIF。
  • 生態系統形成良性循環:高品質的基礎模型促成新資料集的產生,進而產出更強大的微調模型。

民主化存取

模型合併(極致客製化)

  • 合併(平均或加權平均)多個相容模型的權重,有時會使用干擾感知技術(例如 ties merging)。此方式可產生如 llama2‑zephyr‑orca‑ultra 的混合模型,結合多個檢查點的優勢。

參數效率微調(PEFT)

  • 冻結基礎模型,僅訓練輕量的適配器(例如 LoRA、IA³)。只需保存與分享適配器權重,顯著降低儲存與計算需求。

量化(隨處可跑)

  • 降低數值精度(float32 → float16 → int8 → 4‑bit)可減少記憶體佔用:30B 模型的記憶體需求從約 66 GB(float16)降至約 33 GB(8‑bit)或約 16 GB(4‑bit),且在大型模型上性能損失極小。
  • 常用工具套件:bitsandbytes、GPTQ、AWQ;社群轉換工具(例如 TheBloke)使量化檢查點廣為可得。

未來展望

  • Mixture‑of‑Experts (MoE) – Mixtral‑8×7B 會將每個 token 送入八個子模型中的兩個,提升參數量卻不成比例增加計算量。
  • State‑space models – Mamba 與 Striped Hyena 引入 SSM 架構,可能在特定任務上超越 Transformer;相關研究仍處於早期階段。

重點回顧

  • 2023 年開源 LLM 的發布激增,使學術、產業與業餘社群能快速進行實驗。
  • 在 Chinchilla 的擴展洞見之後,趨勢從「越大越好」轉向「較小、資料豐富的模型」。
  • 新的微調範式(RLHF、DPO、適配器、合併)大幅擴展了個人化的可能性。
  • 量化與 PEFT 降低了硬體門檻,使模型能在消費級 GPU 上運行。
  • 來自中國的新興參與者(Qwen、Yi)以及新架構(MoE、SSM)顯示開源 LLM 生態將持續高度競爭。

Sources