Aya Expanse 发布:推动多语言大语言模型性能提升
Hugging Face 和 Cohere For AI 已发布 Aya Expanse 系列,包含 8B 和 32B 参数模型,旨在缩小多语言与单语言 AI 之间的性能差距。这些模型在多语言性能上创下了新最先进记录,在 m-ArenaHard 数据集的两两比较中,32B 模型超越了 Llama 3.1 70B、Gemma 2 27B 和 Mistral 8x22B。
性能基准
Aya Expanse 模型在各自规模类别中相较于其他领先的开源权重模型表现出更优的性能:
- Aya Expanse 32B:超越 Llama 3.1 70B(其规模是其两倍以上)、Gemma 2 27B 和 Mistral 8x22B。
- Aya Expanse 8B:超越 Gemma 2 9B、Llama 3.1 8B 和 Ministral 8B,胜率在 60.4% 到 70.6% 之间。
评估使用了翻译成 23 种语言的 Arena-Hard-Auto 数据集(m-ArenaHard)。
通过多语言套利避免模型崩溃
为应对因过度依赖合成数据而导致的模型崩溃,Cohere For AI 实施了“数据套利”。该技术从教师模型池中进行策略抽样,而不是依赖单一教师模型,这对低资源语言尤为关键,因为没有单一模型能够在所有语言上表现出色。
套利过程:
- 模型池:为特定语言组训练的模型池。
- 仲裁者:内部奖励模型(RM)充当仲裁者,对给定提示下池中所有模型的生成进行打分。
- 基于奖励的路由:选择得分最高的完成作为最终训练数据。
该方法使 8B 模型在 SFT 阶段相较于之前的 Aya 23 模型,对 Gemma 2 9B 的胜率提升了 9.1%。
多语言偏好优化
在多语言环境中对齐人类偏好具有挑战性,因为高质量的非英语偏好数据集稀缺。Aya Expanse 使用了离线与在线相结合的偏好训练流水线:
合成偏好数据生成
团队通过将高性能多语言 LLM 的同语言完成与从英文翻译而来的低质量完成(由较弱模型生成)进行对比,生成了高质量的偏好对。这使模型远离翻译伪影和糟糕的多语言完成。
混合 DPO 流水线
- 离线阶段:模型首先在从套利阶段挑选出的最高和最低奖励响应数据上进行训练。
- 在线迭代 DPO:模型进行三次在线 DPO 迭代。每次迭代中,从当前模型采样多个生成结果,由奖励模型排序,并用于进一步训练。
对于 8B 模型,这种离线与在线相结合的偏好训练使其相较于 Gemma 2 9B 的胜率额外提升了 7.1%。
通过模型合并实现性能最大化
为降低数据混合超参数调优的计算成本,团队采用了模型合并。这包括在不同语言族上训练独立模型,以最大化检查点之间的多样性,同时利用跨语言迁移。
关键合并策略:
- 通过语言族实现多样性:模型在不同语言簇上进行训练以确保差异化,同时在每个簇中加入共享语言(英语、西班牙语和法语)以保持鲁棒性。
- 加权平均:虽然测试了 SLERP、TIES‑merging 和 DARE‑TIES,但加权线性平均被发现是最一致的方法。
- 规模效应:模型合并在 32B 规模上带来的收益显著高于 8B 规模,提升幅度最高可达 3 倍。
后训练流水线概述
最终的 Aya Expanse 模型是多阶段流水线的结果,结合了用于合成数据质量的多语言套利、用于偏好对齐的离线/在线混合 DPO 过程,以及用于在多语言族间优化多任务的策略性模型合并。
SUMMARY: Hugging Face 和 Cohere For AI 已发布 Aya Expanse,这是一系列 8B 和 32B 开源权重模型,创下了多语言性能的新最先进基准。
TITLE: Aya Expanse 发布:推动多语言大语言模型性能提升