Open Ko-LLM Leaderboard

TL;DR

Hugging Face 和 Upstage 推出了 Open Ko-LLM Leaderboard,這是一個專門的評估平台,旨在為韓語大型語言模型 (LLMs) 建立一個透明且具競爭力的生態系統。透過使用私有測試集和韓語特定的基準測試,該排行榜旨在防止數據污染,並準確衡量韓語的語言和文化細微差別。

透過私有測試集進行公平基準測試

Open Ko-LLM Leaderboard 與傳統的基準測試不同,它採用了封閉的測試集環境。雖然許多排行榜使用公開的測試集,但 Open Ko-LLM Leaderboard 將其數據集保持為私有,以防止測試集污染——這是一個常見的問題,即模型在評估數據上進行訓練——並確保模型之間進行更公平的比較。

為了確保文化和語言的相關性,該平台利用了經過翻譯的基準測試數據集,例如 Ko-MMLU,這些數據集經過特別調整,以反映韓語和韓國文化的獨特屬性。

評估任務與指標

該排行榜採用五種不同的評估方法來衡量廣泛的 LLM 能力:

  • Ko-ARC (AI2 Reasoning Challenge): 一項多選題測試,用於評估科學思維、複雜推理和問題解決能力。性能透過準確率來衡量。
  • Ko-HellaSwag: 評估情境理解能力以及預測最可能下一個情境的能力,使用生成式或多選題格式。準確率是主要指標。
  • Ko-MMLU (Massive Multitask Language Understanding): 一項涵蓋各種主題和領域的廣泛多選題測試,用於衡量通用的語言理解能力和多功能性。指標包括整體準確率和特定領域的性能。
  • Ko-Truthful QA: 一項多選題基準測試,用於測試模型從一組選項中辨別事實準確性和真實性的能力,透過選擇準確率來衡量。
  • Ko-CommonGEN V2: 專為 Open Ko-LLM Leaderboard 開發的自定義基準測試,用於評估模型是否能生成符合韓國常識和文化相關性的輸出。

採用情況與模型性能趨勢

在推出後的五個月內,Open Ko-LLM Leaderboard 已收到超過 1,000 個模型提交,其數量已達到原始英文 Open LLM Leaderboard (其擁有超過 4,000 個模型) 的四分之一。參與者包括個人研究人員、學術機構 (例如 KAIST 和 Korea University) 以及企業 (包括 KT, Lotte Information & Communication, 和 Yanolja)。

關鍵性能觀察結果包括:

  • 頂尖表現者: 經過跨語言遷移或韓語特定微調 (例如 Upstage 的 SOLAR) 以及從強大的基礎模型如 LLaMa2, Yi, 和 Mistral 微調而來的模型展現了最強的結果。
  • 值得注意的里程碑: KT 的 Mi:dm 7B 模型在 7B 參數或更少的模型中排名第一,並已開放公眾使用。

基礎設施挑戰與未來願景

該排行榜目前運行在 16 A100 80GB GPUs 上。這套基礎設施對於大於 30 billion 參數的模型會造成瓶頸,這些模型通常會因為高計算需求而導致長時間的等待狀態。

展望未來,組織者旨在演進該排行榜,以解決當前基準測試的常見三大限制:

  1. 數據過時: 引入超越固定數據集 (例如 SQUAD 和 KLEU) 的數據,以反映當前時刻的數據。
  2. 實務應用: 開發衡量模型處理 B2B 和 B2C 服務中常見的邊緣案例 (edge cases) 和異常值 (outliers) 的能力的方法。
  3. 過擬合: 減少「排行榜-中心化」的方法,即模型是專門為測試集進行微調,而非為了實務應用。

最終目標是透過引入與現實世界使用案例強烈相關的基準測試,來彌合學術研究與實際應用之間的差距。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch