Aya Expanse 發布:推進多語言大型語言模型效能
Hugging Face 與 Cohere For AI 已發布 Aya Expanse 系列,提供 8B 與 32B 參數模型,旨在縮小多語言與單語言 AI 之間的效能差距。這些模型在多語言效能上創下新最高紀錄,且 32B 模型在 m-ArenaHard 資料集的兩兩比較中,優於 Llama 3.1 70B、Gemma 2 27B 與 Mistral 8x22B。
效能基準
Aya Expanse 模型在各自規模類別中,展現出相較於其他領先開放權重模型的卓越效能:
- Aya Expanse 32B:優於 Llama 3.1 70B(其規模是其兩倍以上)、Gemma 2 27B 與 Mistral 8x22B。
- Aya Expanse 8B:優於 Gemma 2 9B、Llama 3.1 8B 與 Ministral 8B,勝率介於 60.4% 至 70.6% 之間。
評估使用了翻譯成 23 種語言的 Arena-Hard-Auto 資料集(m-ArenaHard)。
透過多語言仲裁避免模型崩潰
為了對抗因過度依賴合成資料而導致的模型崩潰,Cohere For AI 實施了「資料仲裁」。此技術從教師模型池中策略性抽樣,而非依賴單一教師模型,對於資源稀缺語言尤為關鍵,因為沒有單一模型能在所有語言上表現卓越。
仲裁流程:
- Model Pool:為特定語言群組訓練的模型池。
- Arbiter:內部獎勵模型(RM)作為仲裁者,對給定提示下池中所有模型的生成結果進行打分。
- Reward-Based Routing:選擇得分最高的完成結果作為最終訓練資料。
此方法使 8B 模型在 SFT 階段相較於先前的 Aya 23 模型,對 Gemma 2 9B 的勝率提升了 9.1%。
多語言偏好優化
在多語言環境中對齊人類偏好具有挑戰性,因為高品質的非英語偏好資料集稀缺。Aya Expanse 採用混合離線與線上偏好訓練管線:
合成偏好資料生成
團隊透過比較高效能多語言 LLM 產生的同語言完成與由較弱模型從英文翻譯而來的較低品質完成,生成高品質的偏好對。此舉可使模型遠離翻譯產物與劣質多語言完成的影響。
混合 DPO 管線
- Offline Stage:模型首先在從仲裁階段中挑選出的最高與最低獎勵回應資料上進行訓練。
- Online Iterative DPO:模型進行三次線上 DPO 迭代。每次迭代中,從當前模型抽樣多個生成結果,經獎勵模型排序,並用於進一步訓練。
對於 8B 模型而言,這種離線與線上偏好訓練的結合,使其相較於 Gemma 2 9B 的勝率額外提升了 7.1%。
透過模型合併最大化效能
為降低資料混合超參數調整的計算成本,團隊使用了模型合併。此方法在不同語言族群上訓練獨立模型,以在檢查點之間最大化多樣性,同時利用跨語言遷移。
關鍵合併策略:
- Diversity via Language Families:模型在不同語言叢集上訓練,以確保差異化,同時在每個叢集內加入共享語言(英語、西班牙語與法語)以維持韌性。
- Weighted Averaging:雖然測試了 SLERP、TIES-merging 與 DARE-TIES,但加權線性平均被發現是最一致的方法。
- Scaling Effects:模型合併在 32B 規模下的效益顯著高於 8B 規模,提升幅度最高可達 3 倍。
後訓練管線總結
最終的 Aya Expanse 模型是多階段管線的成果,結合了用於合成資料品質的多語言仲裁、用於偏好對齊的混合離線/線上 DPO 流程,以及策略性模型合併,以在多樣語言族群間優化多任務執行。