Hugging Face 與 LLM-jp 推出開放日語 LLM 排行榜

Hugging Face 與 LLM-jp 研究聯盟已推出開放日語 LLM 排行榜,以提供一個集中且透明的系統,用於評估日語中大型語言模型(LLM)的效能。此舉旨在解決一種語言缺乏開放基準標準的問題,該語言具有獨特的語言挑戰,包括複雜的書寫系統和缺乏詞界限。

全面評估套件

開放日語 LLM 排行榜使用 llm-jp-eval 函式庫來評估模型在 16 個不同任務上的表現,範圍從經典 NLP 到現代推理。這些任務採用 4-shot 提示進行。評估套件包括語言學家和專家從零開發的資料集,以及經過自動翻譯並針對日語文化和語言特異性進行調整的資料集。

主要評估資料集

  • Jamp: 一個用於自然語言推理(NLI)的時間推理基準,測試蘊涵、中立和矛盾。
  • JEMHopQA: 一個多跳問答資料集,旨在評估內部推理和推導生成。
  • jcommonsenseqa: CommonsenseQA 的日語版本,用於評估一般常識推理。
  • chABSA: 一個基於日本上市公司 2016 财政年度財務報告的方面情感分析資料集,遵循金融廳(FSA)分類法。
  • mbpp-ja: 一個透過 DeepL 從 Mostly Basic Python Problems (MBPP) 資料集翻譯而來的程式設計資料集。
  • mawps: 一個數學評估資料集,專注於基本算術和方程式的逐步鏈式思維(CoT)推理,並已針對日語情境進行調整。
  • JMMLU: 一個基於 MMLU**: 一個基於 MMLU 部分的知識資料集,已針對日語公民知識、地理和慣用語進行調整。
  • XL-Sum: 一個抽象摘要資料集,利用 BBC 新聞文章的日語翻譯。

技術實作

排行榜的架構受到 Open LLM Leaderboard 的啟發。技術棧包括:

  • 部署:透過 Hugging Face Inference Endpoints 進行自動部署。
  • 評估框架llm-jp-eval 函式庫(版本 1.14.1)。
  • 推論引擎vLLM(版本 v0.6.3),用於記憶體高效服務。
  • 計算後端:日本的 mdx 高級研究電腦平台。

效能觀察

對排行榜的分析顯示日語 LLM 生態系統中出現幾種趨勢:

  • 架構偏好:Meta 的 Llama 架構在日語 AI 實驗室中廣受青睞,儘管 Mistral 和 Qwen 架構也曾取得最高分數。
  • 開放 vs 閉源:開放原始碼架構正在縮小與閉源模型之間的差距。例如,由 LLM-jp 開發的 llm-jp-3-13b-instruct 模型顯示出與閉源替代方案相當的效能。
  • 剩餘挑戰:多數 LLM 在特定領域任務上仍然遇到困難,包括金融(chABSA)、語言標註(Wikipedia Annotated Corpus)、程式碼生成(mbpp-ja)和摘要生成(XL-Sum)。
  • 文化一致性:由日本公司或實驗室開發的模型在 JCommonsenseMorality 資料集上的表現更佳,該資料集測試模型做出符合日本價值觀的倫理選擇的能力。

未來路線圖

評估框架將會隨著 llm-jp-eval 工具一起演進。規劃的增強功能包括:

  • 擴充資料集:整合 JHumanEval(HumanEval 的日語版本)和 MMLU
  • 進階評估:實施鏈式思維(CoT)評估,以與基本提示進行效能比較。
  • 新指標:引入「Out-of-Choice rate」來衡量模型預測超出提供標籤之 token 的頻率,作為遵循指令能力的代理指標。

Sources