2023 年开放大语言模型回顾
TL;DR
2023 年标志着开源大语言模型(LLM)的快速扩张,出现了众多从 3B 到 70B 参数的新模型,丰富的微调方法,以及让研究者和开发者更易使用 LLM 的工具链。
🍜 预训练 LLM 的构建方式
- 架构 – 大多数表现出色的开源 LLM 使用仅解码器的 Transformer(即 2017 年论文中的经典 “transformer” 设计)。变体包括 ALiBi、RoPE、RMSNorm、SwiGLU,以及注意力改进如 Flash‑Attention、GQA 或滑动窗口。
- 训练数据集 – 文本数据(自然语言、代码、表格、公式)被切分为子词单元;词表通常包含 32k–200k 个 token。现代数据集规模达数千亿至数万亿 token。
- 分词器 – 将原始文本转换为数值 token ID;数据集的 token 数是衡量规模的主要指标。
- 训练超参数 – 定义学习率、批量大小以及其他优化器设置,决定权重的更新方式。
- 算力 – 大规模训练需要庞大的 GPU/TPU 集群并进行细致监控。
- 权重 – 训练得到的参数以模型检查点形式发布,供推理和下游微调使用。
- 微调 – 开放的权重使得在特定任务上进行低成本适配成为可能,所需算力远低于从头训练。
🗝️ 2022:从规模驱动到数据驱动的转变
- BLOOM(BigScience,176B 参数,350B token,多语言)– 开源,完整记录的数据流水线。
- OPT(Meta,175B 参数,180B token)– 通过算力高效技巧实现 GPT‑3 级别性能。
- GLM‑130B(清华/智谱 AI,130B 参数,400B token)– 与 GPT‑3 相当,采用 DeepNorm 与旋转嵌入。
- 较小的开源模型 – Galactica(最高 120B,科学文本)和 GPT‑NeoX‑20B(20B,500B token)展示了全开源堆栈的可行性。
- 规模法则的转变 – DeepMind 的 Chinchilla 论文(70B 参数,1.4T token)表明,在固定算力预算下,使用更多数据训练的较小模型优于数据匮乏的更大模型。此洞见推动了全社区向 “更多数据、更小模型” 的方向转变。
🌊 2023:一波接一波的开源发布
小型 LLM 的崛起(3B–70B)
- LLaMA(Meta,2 月) – 65B 参数模型,训练于 1.4T token;6B/13B 变体使用 1T token;非商业许可证。
- Pythia(EleutherAI,4 月) – 公开数据的规模化模型套件。
- MPT(MosaicML,5 月) – 7B 与 30B 模型,商业友好许可证,使用 1T token 的英文+代码数据训练。
- Falcon(TII‑UAE,6 月) – 7B/30B(后续 180B)模型,1–1.5T token,附详细技术报告。
- StableLM(StabilityAI,4 月 & 8 月) – 3B/7B 基础模型(1.5T token),随后推出混合数据来源的 v2 系列。
- X‑Gen(Salesforce,6 月) – 7B 模型,1.5T token,分阶段数据调度。
- LLaMA‑2(Meta,7 月) – 7–70B 模型,2T token,宽松的社区许可证,广泛的 RLHF 对齐。
- Mistral‑7B(Mistral.AI,9 月) – 使用未公开的网络数据训练;后续的 Mixtral‑8×7B 引入 MoE 路由。
- Qwen(阿里巴巴,9 月) – 7–70B 模型,2.4T token,聚焦中英双语。
- Yi(01‑AI,11 月) – 6–34B 模型,3T token,排行榜表现强劲。
- DeciLM、SOLAR 等(Deci、Upstage 等) – 在 7–10B 规模上持续迭代提升。
这些发布的共同点:
- 采用仅解码器的 Transformer 核心。
- 各种架构微调(ALiBi、RoPE、RMSNorm、SwiGLU、Flash‑Attention、GQA、滑动窗口)。
- 权重开放,许可证从非商业到完全宽松不等。
- 强调在海量 token 上训练较小模型,呼应 Chinchilla 的洞见。
对话模型遍地开花
- 基于聊天的微调 – 在多轮对话数据上进行监督训练。
- 指令微调(IFT) – 使用指令‑响应对,常为合成数据(如 GPT‑4 生成)。
- RLHF – 人类对响应进行排序,训练偏好模型,再用于强化学习;成本高但提升安全性。
- RLAIF – 用高质量 LLM 替代人工排序进行偏好打分。
- 直接偏好优化(DPO) – 直接依据排序数据更新模型,省去单独的偏好模型。
大多数 2023 年的发布都提供了基础检查点和聊天微调变体(例如 LLaMA‑2‑Chat、Falcon‑Instruct、MPT‑Chat、Qwen‑Chat、Yi‑Chat)。其中 LLaMA‑2 的安全对齐尤为突出。
社区活动
- 指令与聊天数据集大量涌现:WebGPT、HH‑RLHF、P3、FLAN、Self‑Instruct、HC3、Alpaca、OIG、Vicuna、UltraChat、Open‑Orca、UltraFeedback、Zephyr、OpenHermes、Starling、Nectar 等。
- 社区微调(Alpaca、Koala、Dolly、UltraLLaMA、Hermes、Capybara、OpenChat 等)基于基础模型构建,常结合 RLHF、DPO 或 RLAIF。
- 生态形成良性循环:高质量基础模型催生新数据集,进而产出更强的微调模型。
民主化访问
模型合并(极致定制)
- 合并是对多个兼容模型的权重进行平均或加权平均,有时使用干扰感知技术(如 ties 合并)。这可以产生诸如
llama2‑zephyr‑orca‑ultra的混合体,融合多个检查点的优势。
参数高效微调(PEFT)
- 冻结基础模型,仅训练轻量适配器(如 LoRA、IA³)。只需保存和共享适配器权重,大幅降低存储和算力需求。
量化(随处运行)
- 降低数值精度(float32 → float16 → int8 → 4‑bit)可显著削减内存占用:30B 模型从约 66 GB(float16)降至约 33 GB(8‑bit)或约 16 GB(4‑bit),对大模型的性能影响极小。
- 主流工具包:bitsandbytes、GPTQ、AWQ;社区转换器(如 TheBloke)让量化检查点广泛可得。
未来展望
- 混合专家(MoE) – Mixtral‑8×7B 将每个 token 路由至八个子模型中的两个,实现参数规模的提升而计算成本不成比例增长。
- 状态空间模型(SSM) – Mamba 与 Striped Hyena 引入的 SSM 架构在某些任务上可能超越 Transformer;研究仍处于早期阶段。
要点回顾
- 2023 年开源 LLM 发布呈爆炸式增长,推动学术、工业和业余社区的快速实验。
- 在 Chinchilla 规模洞见的推动下,趋势从 “更大更好” 转向 “更小、数据更丰富”。
- 新的微调范式(RLHF、DPO、适配器、合并)极大扩展了个性化可能性。
- 量化与 PEFT 降低了硬件门槛,使模型能够在消费级 GPU 上运行。
- 来自中国的参与者(Qwen、Yi)以及新架构(MoE、SSM)表明开源 LLM 生态将保持高度竞争性。
Sources
- Original2023, year of open LLMs