Alyah:阿聯酋方言基準測試(針對阿拉伯語大型語言模型)
TL;DR
Hugging Face 與合作夥伴發布了 Alyah,這是一個專門的基準測試,旨在評估大型語言模型(LLMs)如何處理阿聯酋方言。此發布填補了阿拉伯語自然語言處理領域的一個關鍵空白,因為大多數現有基準測試聚焦於現代標準阿拉伯語(MSA),導致文化豐富且主要以口語形式存在的阿聯酋方言未受到充分評估。
Alyah 基準測試:範圍與動機
Alyah(在阿聯酋方言中意為「北極星」)旨在超越表層詞彙知識,測試模型解讀文化內嵌意義、語用使用以及方言特有細微差異的能力。由於阿聯酋方言與在地遺產、詩歌與口頭敘事緊密相連,常包含無法透過從 MSA 的字面翻譯推斷出的表達。
資料集組成
此基準測試包含 1,173 個人工收集的樣本,來自阿聯酋本土說話者,以確保語言真實性。每個樣本都是一個四選一的多項選擇題(有一個正確答案,另外三個為經過可行性審查的合成干擾項)。
資料集分為七個類別,難度層級各異:
| 類別 | 樣本數量 | 難度 |
|---|---|---|
| 語言與方言 | 619 | 困難 |
| 禮儀與價值觀 | 173 | 中等 |
| 意象與比喻意義 | 121 | 中等 |
| 歷史與遺產知識 | 89 | 困難 |
| 宗教與社會敏感性 | 78 | 中等 |
| 問候與日常表達 | 61 | 容易 |
| 詩歌與創意表達 | 32 | 困難 |
模型評估與方法論
研究人員評估了 54 個語言模型,其中包括 23 個基礎模型與 31 個指令微調模型。評估池涵蓋阿拉伯語本土 LLM(例如 Jais、Allam)、具備阿拉伯語支援的多語言模型(例如 Qwen、Llama)以及區域專屬模型(例如 Fanar、AceGPT)。
評分協議
模型的評估依據 語意正確性與適切性(針對阿聯酋方言的使用)而非文字的字面重疊。每個類別的難度層級是根據模型整體表現的觀測結果以實證方式確定的。
主要發現與效能趨勢
評估結果顯示,儘管部分模型表現良好,但表層熟悉度與深層文化理解之間仍存在顯著差距。
指令微調的影響
指令微調模型普遍優於基礎模型,尤其在涉及對話規範、禮儀與比喻意義的類別中。這顯示對齊與指令微調有助於模型更好地利用其已有的基於 MSA 的意象知識,以應對方言模式。
效能瓶頸
- 最困難的類別:「語言與方言」以及「問候與日常表達」在所有模型規模中始終是最具挑戰性的。這是因為阿聯酋方言主要以口語形式存在且少有書寫,限制了可供 LLM 訓練的資料量。
- **多語言模型的限制:**即使是表現優異的多語言模型,在最具挑戰性的 Alyah 問題上也顯著下降,顯示方言特有的語意知識不易透過通用的多語言訓練獲得。
- **阿拉伯語本土模型的優勢:**阿拉伯語本土模型在文化根基內容上通常表現更為穩健,儘管在不同類別間的效能仍不均衡。
表現最佳的模型
- 基礎模型:
google/gemma-3-27b-pt以 74.68% 的正確率領先,其次是tiiuae/Falcon-H1-34B-Base(73.66%)。 - 指令微調模型:
falcon-h1-arabic-7b-instruct取得最高正確率 82.18%,其後是humain-ai/ALLaM-7B-Instruct-preview(77.24%)。 - 整體表現: 最高分的大型模型為
Jais-2-70B,而在較小模型中,jais-2-8B與ALLaM-7B-instruct表現領先。
對阿拉伯語 LLM 發展的啟示
Alyah 作為診斷工具,凸顯方言能力是多維度的。模型能處理比喻語言並不保證其在詩歌或遺產相關問題上的熟練度。此基準測試旨在指導未來的資料收集與訓練工作,打造更能滿足阿聯酋使用者特定語言與文化需求的模型。