Open Ko-LLM Leaderboard
TL;DR
Hugging Face 和 Upstage 推出了 Open Ko-LLM Leaderboard,這是一個專門的評估平台,旨在為韓語大型語言模型 (LLMs) 建立一個透明且具競爭力的生態系統。透過使用私有測試集和韓語特定的基準測試,該排行榜旨在防止數據污染,並準確衡量韓語的語言和文化細微差別。
透過私有測試集進行公平基準測試
Open Ko-LLM Leaderboard 與傳統的基準測試不同,它採用了封閉的測試集環境。雖然許多排行榜使用公開的測試集,但 Open Ko-LLM Leaderboard 將其數據集保持為私有,以防止測試集污染——這是一個常見的問題,即模型在評估數據上進行訓練——並確保模型之間進行更公平的比較。
為了確保文化和語言的相關性,該平台利用了經過翻譯的基準測試數據集,例如 Ko-MMLU,這些數據集經過特別調整,以反映韓語和韓國文化的獨特屬性。
評估任務與指標
該排行榜採用五種不同的評估方法來衡量廣泛的 LLM 能力:
- Ko-ARC (AI2 Reasoning Challenge): 一項多選題測試,用於評估科學思維、複雜推理和問題解決能力。性能透過準確率來衡量。
- Ko-HellaSwag: 評估情境理解能力以及預測最可能下一個情境的能力,使用生成式或多選題格式。準確率是主要指標。
- Ko-MMLU (Massive Multitask Language Understanding): 一項涵蓋各種主題和領域的廣泛多選題測試,用於衡量通用的語言理解能力和多功能性。指標包括整體準確率和特定領域的性能。
- Ko-Truthful QA: 一項多選題基準測試,用於測試模型從一組選項中辨別事實準確性和真實性的能力,透過選擇準確率來衡量。
- Ko-CommonGEN V2: 專為 Open Ko-LLM Leaderboard 開發的自定義基準測試,用於評估模型是否能生成符合韓國常識和文化相關性的輸出。
採用情況與模型性能趨勢
在推出後的五個月內,Open Ko-LLM Leaderboard 已收到超過 1,000 個模型提交,其數量已達到原始英文 Open LLM Leaderboard (其擁有超過 4,000 個模型) 的四分之一。參與者包括個人研究人員、學術機構 (例如 KAIST 和 Korea University) 以及企業 (包括 KT, Lotte Information & Communication, 和 Yanolja)。
關鍵性能觀察結果包括:
- 頂尖表現者: 經過跨語言遷移或韓語特定微調 (例如 Upstage 的 SOLAR) 以及從強大的基礎模型如 LLaMa2, Yi, 和 Mistral 微調而來的模型展現了最強的結果。
- 值得注意的里程碑: KT 的 Mi:dm 7B 模型在 7B 參數或更少的模型中排名第一,並已開放公眾使用。
基礎設施挑戰與未來願景
該排行榜目前運行在 16 A100 80GB GPUs 上。這套基礎設施對於大於 30 billion 參數的模型會造成瓶頸,這些模型通常會因為高計算需求而導致長時間的等待狀態。
展望未來,組織者旨在演進該排行榜,以解決當前基準測試的常見三大限制:
- 數據過時: 引入超越固定數據集 (例如 SQUAD 和 KLEU) 的數據,以反映當前時刻的數據。
- 實務應用: 開發衡量模型處理 B2B 和 B2C 服務中常見的邊緣案例 (edge cases) 和異常值 (outliers) 的能力的方法。
- 過擬合: 減少「排行榜-中心化」的方法,即模型是專門為測試集進行微調,而非為了實務應用。
最終目標是透過引入與現實世界使用案例強烈相關的基準測試,來彌合學術研究與實際應用之間的差距。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch