Hugging Face 與 LLM-jp 推出開放日語 LLM 排行榜
Hugging Face 與 LLM-jp 研究聯盟已推出開放日語 LLM 排行榜,以提供一個集中且透明的系統,用於評估日語中大型語言模型(LLM)的效能。此舉旨在解決一種語言缺乏開放基準標準的問題,該語言具有獨特的語言挑戰,包括複雜的書寫系統和缺乏詞界限。
全面評估套件
開放日語 LLM 排行榜使用 llm-jp-eval 函式庫來評估模型在 16 個不同任務上的表現,範圍從經典 NLP 到現代推理。這些任務採用 4-shot 提示進行。評估套件包括語言學家和專家從零開發的資料集,以及經過自動翻譯並針對日語文化和語言特異性進行調整的資料集。
主要評估資料集
- Jamp: 一個用於自然語言推理(NLI)的時間推理基準,測試蘊涵、中立和矛盾。
- JEMHopQA: 一個多跳問答資料集,旨在評估內部推理和推導生成。
- jcommonsenseqa: CommonsenseQA 的日語版本,用於評估一般常識推理。
- chABSA: 一個基於日本上市公司 2016 财政年度財務報告的方面情感分析資料集,遵循金融廳(FSA)分類法。
- mbpp-ja: 一個透過 DeepL 從 Mostly Basic Python Problems (MBPP) 資料集翻譯而來的程式設計資料集。
- mawps: 一個數學評估資料集,專注於基本算術和方程式的逐步鏈式思維(CoT)推理,並已針對日語情境進行調整。
- JMMLU: 一個基於 MMLU**: 一個基於 MMLU 部分的知識資料集,已針對日語公民知識、地理和慣用語進行調整。
- XL-Sum: 一個抽象摘要資料集,利用 BBC 新聞文章的日語翻譯。
技術實作
排行榜的架構受到 Open LLM Leaderboard 的啟發。技術棧包括:
- 部署:透過 Hugging Face Inference Endpoints 進行自動部署。
- 評估框架:
llm-jp-eval函式庫(版本 1.14.1)。 - 推論引擎:
vLLM(版本 v0.6.3),用於記憶體高效服務。 - 計算後端:日本的 mdx 高級研究電腦平台。
效能觀察
對排行榜的分析顯示日語 LLM 生態系統中出現幾種趨勢:
- 架構偏好:Meta 的 Llama 架構在日語 AI 實驗室中廣受青睞,儘管 Mistral 和 Qwen 架構也曾取得最高分數。
- 開放 vs 閉源:開放原始碼架構正在縮小與閉源模型之間的差距。例如,由 LLM-jp 開發的
llm-jp-3-13b-instruct模型顯示出與閉源替代方案相當的效能。 - 剩餘挑戰:多數 LLM 在特定領域任務上仍然遇到困難,包括金融(
chABSA)、語言標註(Wikipedia Annotated Corpus)、程式碼生成(mbpp-ja)和摘要生成(XL-Sum)。 - 文化一致性:由日本公司或實驗室開發的模型在
JCommonsenseMorality資料集上的表現更佳,該資料集測試模型做出符合日本價值觀的倫理選擇的能力。
未來路線圖
評估框架將會隨著 llm-jp-eval 工具一起演進。規劃的增強功能包括:
- 擴充資料集:整合
JHumanEval(HumanEval 的日語版本)和MMLU。 - 進階評估:實施鏈式思維(CoT)評估,以與基本提示進行效能比較。
- 新指標:引入「Out-of-Choice rate」來衡量模型預測超出提供標籤之 token 的頻率,作為遵循指令能力的代理指標。