BenCzechMark:針對捷克語 LLM 的全面評估套件
Hugging Face 與 BUT FIT、FI MUNI 以及 CIIRC CTU 合作,推出了 BenCzechMark,這是首個針對捷克語大型語言模型(LLM)能力進行全面評估的套件。此基準提供了一個標準化框架,用以衡量推理、語法正確性、捷克文化的事實知識以及語言模型的概率。
基準組成與任務類別
BenCzechMark 包含 50 項任務,跨 9 個類別,其中 90% 為原生捷克語內容,10% 為翻譯(主要透過 CUBBITT 與 DeepL)。此套件在以下維度評估模型:
- 閱讀理解:使用 Belebele(Accuracy)和 SQAD3.2(Exact Match)測試從上下文中提取資訊。
- 事實知識:透過 Umimeto(Accuracy)、TriviaQA(Exact Match)和 NaturalQuestions(Exact Match)測試已儲存的知識。
- 捷克語理解:聚焦語法與細微差異,使用 CERMAT(EM/AUROC/Acc)、Grammar Error Detection(AUC)以及 Agree(Accuracy)。
- 語言模型:透過 Czech National Corpus(Perplexity)和 HellaSwag(Accuracy)衡量文本抽樣的可能性。
- 捷克語數學推理:使用 Klokan QA(Accuracy)、CERMAT(Exact Match/Accuracy)以及 Umimeto Math(Accuracy)評估問題解決能力。
- 自然語言推理:使用 Czech SNLI(AUROC)、CSFever(AUROC)、CTKFacts(AUROC)和 Propaganda(AUROC)測試蕴含與支持。
- 命名實體識別(NER):使用 CNEC2.0(Exact Match)和 Court Decisions(Exact Match)辨識實體類型。
- 情感分析:透過 Subjectivity(AUROC)和 CzechSentiment(AUROC)量化情感。
- 文件檢索:使用 Historical IR(Accuracy)找出相關段落。
評估指標
為了處理多樣的任務類型,基準採用四項主要指標:
- Accuracy(Acc):用於多選題任務。
- Exact Match(EM):用於開放式短答生成。
- Area Under the Receiver Operating Characteristic Curve(AUROC):用於分類,避免閾值校準的需求,確保模型之間的比較更公平。
- Word-level Perplexity(Ppl):用於語言模型任務,依語料庫中的每個詞進行正規化。
新穎的對決計分機制
由於基準使用多種尺度不同的指標,簡單平均不可行。BenCzechMark 引入 Duel Win Score(DWS) 以決定最終排名。
對於每項任務,模型會以 α=0.05 的統計顯著性檢驗進行比較。使用的檢驗包括單尾配對 t 檢驗(針對 ACC 與 EM)、貝葉斯檢驗(針對 AUROC)以及自助抽樣(針對 Ppl)。模型的 DWS 為其在特定任務中相較於所有其他模型贏得的「對決」比例。最終的綜合分數為 Macro-averaged model win-rate,即各類別 DWS 的平均值。
模型表現與排行榜結果
對 26 個開放權重模型(使用 3-shot 範例、2048 token 輸入長度,並以平均池化方式聚合對數機率)進行評估後,得到以下主要發現:
- Llama-405B 為排行榜上整體表現最佳的模型。
- Qwen-72B 在數學與資訊檢索方面表現優異,但在其他類別上稍遜。
- Aya-23-35B 在情感分析與語言模型方面表現突出。
- Gemma-2 9B 在捷克語閱讀理解上超越了顯著更大的模型。
研究人員與開發者可透過專屬的 Hugging Face Space 向 BenCzechMark 排行榜提交自己的模型,進一步推動以捷克語為中心的 LLM 發展。