FilBench:評估大型語言模型在菲律賓語言的能力
Hugging Face 推出了 FilBench,一套全面的評估套件,旨在評估大型語言模型在塔加洛語、菲律賓語與宿務語的流暢度、語言能力與文化知識。此基準提供了一種系統化的方法,讓我們超越對大型語言模型在菲律賓語言流暢度的零星證據,建立以資料為基礎的模型效能理解。
FilBench 框架與方法論
FilBench 是一套結構化的評估套件,包含 12 個任務,分為四個主要類別。為確保此基準能反映實際的自然語言處理研究與使用趨勢,這些類別是根據 2006 年至 2024 年初的菲律賓語言 NLP 研究歷史調查所策劃。大多數類別使用未翻譯的內容,以保持語言自然使用的忠實度。
評估類別
- 文化知識: 測試回憶事實性與文化特定資訊的能力。包括區域知識(Global-MMLU)、以菲律賓為中心的價值觀(KALAHI)以及詞義消歧(StingrayBench)。
- 傳統 NLP: 包含資訊抽取與語言任務,傳統上由專門模型處理,包括命名實體辨識(CebuaNER、TLUnified-NER 與 Universal NER)、文本分類,以及情感分析(SIB-200 與 BalitaNLP 的子集)。
- 閱讀理解: 透過可讀性、理解度與自然語言推理來評估菲律賓語文本的詮釋(Cebuano Readability Corpus、Belebele 與 NewsPH NLI)。
- 生成: 專注於翻譯忠實度,特別是英語至菲律賓語以及宿務語至英語的翻譯,使用 NTREX-128、Tatoeba 與 TICO-19 等資料集。
實作與評分
FilBench 建立於 Lighteval 框架之上。研究人員為常見的評估詞彙定義了特定的翻譯對應(例如「yes」對應 oo,「no」對應 hindi),並使用提供的模板實作自訂任務。最終結果以 FilBench 分數 表示,這是一個根據每個類別範例數量加權的平均值。
大型語言模型評估的主要發現
對超過 20 個最先進的大型語言模型進行評估,揭示了關於它們在菲律賓語言表現的三項主要見解。
區域特定模型 vs. 通用模型
東南亞(SEA)特定的大型語言模型,如 SEA-LION 與 SeaLLM,是在菲律賓語言上最具參數效率的模型,取得比其他同等規模模型更高的 FilBench 分數。然而,它們仍被閉源模型如 GPT-4o 超越。
儘管存在此差距,研究顯示持續以 SEA 特定的指令微調資料對基礎大型語言模型進行微調,可提升 2-3% 的效能,這表明整理菲律賓語與 SEA 特定的訓練資料仍是提升模型的高效方向。
生成與翻譯的挑戰
生成是所有評估模型中最具挑戰性的類別。翻譯任務的常見失敗模式包括:
- 未遵循翻譯指示。
- 產生過於冗長的文本。
- 出現除塔加洛語或宿務語之外的語言幻覺。
開放權重模型的成本效益
在 Hugging Face 上可取得的開放權重大型語言模型提供了一種具成本效益的替代方案,可在不顯著犧牲效能的情況下取代商業模型。對於尋找 GPT-4o 替代方案以處理菲律賓語任務的使用者,研究人員指出 Llama 4 Maverick 是效率帕累托前緣上的強力選擇。
資源與取得方式
FilBench 以社群任務的形式提供於官方 Lighteval 倉庫。開發者可透過 arXiv (2508.03523) 取得完整研究論文,並可於 GitHub 獲得評估程式碼。