Falcon-Arabic:阿拉伯語言模型的突破

科技創新研究院(TII)推出了 Falcon-Arabic,一款 7B 參數的語言模型,為阿拉伯自然語言處理(NLP)樹立了新的效能基準。透過調整 Falcon 3 架構,該模型在阿拉伯語文法、數學推理與方言理解方面提供了最先進的能力,表現優於規模高達四倍的模型。

技術架構與訓練流程

Falcon-Arabic 是透過調整 Falcon 3-7B 多語言基礎模型而非從頭訓練而開發的。之所以採用此方式,是因為調整過的多語言模型在 Open Arabic LLM Leaderboard 上持續展現出更高的效率與能力。

分詞器與嵌入調整

由於 Falcon 3-7B 在分詞器與嵌入層面缺乏原生阿拉伯語支援,TII 實施了兩項主要修改:

  • 詞彙擴充:分詞器新增了 32,000 個阿拉伯語專屬詞彙。
  • 相似度初始化:採用基於文本相似度的全新嵌入初始化策略,將新阿拉伯語詞彙映射到現有詞彙表中語義相關的嵌入。此舉使模型能繼承先前關於推理模式與抽象概念的知識。

預訓練課程

模型使用 100% 原生阿拉伯語資料集進行持續預訓練,以避免機器翻譯內容常帶來的文化偏見。訓練遵循多階段課程:

  1. 初始階段:聚焦於一般知識與方言豐富的阿拉伯語內容,以穩定模型。
  2. 後續階段:強調數學推理、程式編寫與複雜問題解決。

效能基準

Falcon-Arabic 使用 OALL v2(Open Arabic LLM Leaderboard)進行評估,該排行榜包含六項選擇題任務(原生與翻譯的 Arabic MMLU、Arabic Exams、Alghafa、MadinahQA 與 Aratrust)以及一項生成式基準(Alrage)。

基礎模型效能

Falcon-Arabic-7B-Base 在多項關鍵基準上領先,包括 Arabic MMLU、Exams、MadinahQA 與 Aratrust。它優於同尺寸類別的所有現有阿拉伯語 LLM,且超越規模高達四倍的模型。

指令模型效能

在預訓練之後,模型進行後訓練對齊,產生 Falcon-Arabic-7B-Instruct。此過程包括:

  • 監督式微調 (SFT):使用高品質的公開資料集以及內部收集的原生阿拉伯語指令資料。
  • 直接偏好優化 (DPO):一種強化學習方法,用於使輸出符合人類在安全性、相關性與有用性方面的偏好。

Falcon-Arabic Instruct 在同尺寸類別中優於所有其他指令對齊的阿拉伯語 LLM,且在指令遵循與開放式對話方面超越顯著更大的模型。

能力與應用

Falcon-Arabic 支援 32,000 個 token 的上下文長度,使其適用於知識密集型任務與長文件處理。主要能力包括:

  • 檢索增強生成 (RAG):處理長上下文以提供有根據的答案。
  • 多語言能力:支援阿拉伯語、英語及其他多種語言。
  • 方言理解:流利掌握現代標準阿拉伯語(MSA)與各種區域方言。
  • 零樣本翻譯:儘管未針對此任務進行特別微調,模型仍展現出強大的機器翻譯能力。

限制

Falcon-Arabic 仍受限於一般大型語言模型的常見限制,包括:

  • 幻覺:可能產生看似合理卻不正確的資訊。
  • 提示敏感度:根據提示的表述方式,效能會有所變化。
  • 上下文長度:在處理極長上下文時,效能會有所波動。

Sources