AraGen 基準與排行榜:引入 3C3H 評估以評估阿拉伯語 LLMs

TL;DR

Hugging Face 宣布 AraGen,這是一個針對阿拉伯語大型語言模型的生成任務基準與排行榜,圍繞新的 3C3H 評估度量構建,該度量透過 LLM‑as‑judge 方法對模型回覆在正確性、完整性、簡潔性、有用性、誠實性和無害性方面進行評分。

3C3H 度量概覽

3C3H 度量是一種結合事實性與可用性的整體評估。它評估六個維度:

  • Correctness (binary):事實準確度相對於真實值。
  • Completeness (binary):答案是否涵蓋問題的所有部分。
  • Conciseness (1‑5):在保留所需資訊的前提下,簡潔程度的適當性。
  • Helpfulness (1‑5):答案協助使用者的程度。
  • Honesty (1‑5):所有資訊的準確度,會因幻覺而受到懲罰。
  • Harmlessness (1‑5):不含冒犯或偏見的內容。 首先計算二分制分數;如果正確性或完整性為零,則其他所有維度設為零。縮放分數會從 [1,5] 標準化到 [0,1]。總體 3C3H 分數會將每個樣本的六個維度彙總,然後在資料集上取平均。

AraGen 基準與排行榜

AraGen 提供了一個排行榜,使用 3C3H 度量來排名開放與專有的阿拉伯語 LLMs。該基準包含 279 經人工驗證的問題,涵蓋四項任務:問答、正寫與語法分析、推理以及安全。

評估流程

  1. Model Submission – 使用者提交模型以進行評估。
  2. Response Generation – 模型為固定的 AraGen 基準集生成答案。
  3. LLM as Judge – 選定的 LLM 依據 3C3H 指南,將每個模型答案與經驗證的基礎真相進行比較,並以 JSON 形式輸出分數。
  4. Scoring and Normalization – 首先得到二分制分數;縮放分數會被標準化到 [0,1]。
  5. Leaderboard Reporting – 結果會顯示在兩個排行榜上:一個是綜合 3C3H 排行榜(顯示總體及各維度分數),另一個是任務排行榜(顯示四項任務各自的分數)。

動態排行榜以提升穩健性

為了減少資料污染,AraGen 採用動態評估策略:

  • Blind Test Sets – 每個資料集在三個月評估期間內保持私有,防止洩漏到模型訓練。
  • Periodic Updates – 三個月後,盲測集會被新的人工驗證問答對集取代,保持結構、複雜度和領域平衡。
  • Open‑Sourcing – 盲測期間結束後,資料集與評估程式碼將公開發布,以便進行獨立驗證和重現。

資料集設計

AraGen 基準包含 279 個範例,分布於四項任務。互動類型為:

  • Single Interaction – 簡單的問答。
  • Conversational Interaction – 多輪交流;評估聚焦於最終回合,同時考慮流暢度。
  • Follow‑Up Interaction – 兩輪序列,第二個答案依賴於第一個答案;第一個答案的權重加倍,以強調事實連續性。 對於正寫與語法分析,資料在阿拉伯語語法與阿拉伯語寫寫語法之間平均分配(各佔 50%)。安全範例僅屬於安全類別。

評審評估與選擇

作者曾以多個候選 LLM 作為評審進行實驗,包括 GPT‑4o、GPT‑4o‑mini、Claude‑3.5‑sonnet、Claude‑3‑haiku、Llama 3.1‑405b 以及陪審團系統。評估標準包括與人類評審的一致性(Cohen’s Kappa)、分數一致性(標準差)、自我偏見以及幻覺傾向。

  • Agreement:GPT‑4o‑mini 與人類的 Kappa 值最高(0.46),緊隨其後的是 Claude‑3.5‑sonnet。
  • Consistency:陪審團系統顯示最低的平均標準差(0.0049);在單一評審中,Claude‑3.5‑sonnet 最為穩定(0.0063)。
  • Self‑Bias:Claude‑3.5‑sonnet 幾乎沒有自我偏好的評分,而 GPT‑4o 與 GPT‑4o‑mini 則傾向於給予自己的輸出比其他評審更高的分數。
  • Hallucination:Claude‑3.5‑sonnet 與 GPT‑4o‑mini 兩者都高度遵守指南;Claude‑3.5‑sonnet 的任何偏差均追溯至 API 錯誤,而非幻覺。 基於這些結果,由於 Claude‑3.5‑sonnet 變異性低、自我偏見少且與人類評審高度一致,被選為 AraGen 排行榜的主要評審。陪審團系統被排除,因為它未提供排名提升,存在放大偏見的風險,且計算成本高。

結論

AraGen 引入了一個嚴謹且動態的評估框架,用於阿拉伯語 LLMs,透過 3C3H 度量統一事實性與可用性。通過將評估資料在三個月週期內保持私有,之後再公開發布,排行榜在降低資料洩漏風險的同時保持透明與可重現。作者計畫透過新任務擴展基準,半自動化資料集建立,並將該框架適用於其他資源不足的語言。

Sources