Hugging Face 針對希伯來語 LLM 的開放排行榜
Hugging Face 已推出針對希伯來語大型語言模型(LLM)的開放排行榜,提供一套標準化的評估框架,針對這類在一般 LLM 基準測試中常被忽視的語言。此計畫旨在透過解決希伯來語特有的形態學複雜性,促進語言與文化上更精確的模型開發。
應對希伯來語語言挑戰
希伯來語是一種形態豐富的語言,具備根與詞形變化的複雜系統,前綴、後綴與內插詞會改變詞義、時態與數量。傳統的斷詞策略多為形態較簡單的語言設計,往往無法有效處理希伯來語,導致現有 LLM 在處理此語言的細微差異時表現不佳,亟需能反映這些獨特語言特性的專屬基準測試。
評估指標與基準測試
排行榜使用四個關鍵資料集來測試模型對希伯來語的理解與生成能力。這些基準測試採用 few‑shot 提示格式,確保模型在有限上下文下仍能正確適應與回應。
希伯來語問答
此任務評估模型理解希伯來語句法與語意的能力,並能根據提供的上下文正確檢索答案。使用 HeQ 資料集的測試子集。
情感準確度
此基準測試評估模型根據語言線索將希伯來語陳述分類為正面、負面或中性。使用 Hebrew Sentiment 資料集。
Winograd Schema Challenge
此任務衡量模型透過邏輯推理與一般世界知識解決代名詞指代與上下文歧義的能力。使用 Dr. Vered Schwartz 提供的 Winograd Schema Challenge 的希伯來語翻譯版。
翻譯
此基準測試評估模型在英語與希伯來語之間翻譯的熟練度,重點在語言準確性、流暢度與意義保留。使用 NeuLabs‑TedTalks 對齊翻譯語料庫。
技術實作
排行榜是以 Demo Leaderboard template 建置,靈感來自 Open LLM Leaderboard。技術流程如下:
- Deployment:提交的模型會自動透過 Hugging Face Inference Endpoints 部署。
- Evaluation:模型透過 lighteval 函式庫管理的 API 請求進行評估。
贊助與合作
本計畫由 DDR&D IMOD / The Israeli National Program for NLP in Hebrew and Arabic 贊助,並與 DICTA: The Israel Center for Text Analysis 及 Webiks 合作。Bar‑Ilan University 的 Prof. Reut Tsarfaty 提供了科學諮詢與指導。