Hugging Face 開放式思考鏈領導榜

Hugging Face 推出了開放式思考鏈(CoT)領導榜,這是一個專門的評估框架,旨在衡量思考鏈提示在複雜推理任務中實際提升模型準確率的程度。與追蹤絕對準確率的傳統領導榜不同,該領導榜聚焦於推理過程本身帶來的邊際提升。

透過準確率提升衡量推理的影響

開放式 CoT 領導榜透過計算模型在有與無 CoT 提示下的表現差異,來評估其推理痕跡的有效性。此方法旨在將推理過程的影響與模型的基線知識分離。

準確率提升公式: accuracy gain Δ = accuracy with CoT – accuracy w/o CoT

為了建立基線(無 CoT 的準確率),領導榜使用多選題的對數似然準確率。此方法旨在對抗訓練資料污染更具韌性;即使模型在訓練時見過特定答案,它仍可能難以產生有效的推理路徑以達到該答案。

評估任務與基準

領導榜使用需要常識與一般推理的任務,確保即使是高效能的大型語言模型也仍感到挑戰。所有任務皆以多選題形式呈現。

評估套件包括:

  • LogiQA: 包含原始版本的新翻譯以及 2.0 版。
  • LSAT: 包含聚焦於分析推理、邏輯推理與閱讀理解的子集。

這些任務大多取自 AGIEval 基準,並透過 logikon-bench 重新發布。

CoT 生成模式與提示策略

為了涵蓋多樣的 CoT 提示技術,領導榜採用模組化的提示鏈,並在六種不同的「生成模式」(兩種提示策略與三種解碼參數的組合)下測試模型。

提示策略

  1. Classic(經典): 顯示問題後,接著指示「讓我們一步一步思考」。
  2. Reflect(反思): 指示模型先就問題進行一般性的反思,然後再進行一步一步的解答。

解碼參數

  • 貪婪解碼
  • 束搜索 (n=2)
  • 抽樣 (T=.3)

對於測試資料集中的每個範例,模型會在六種模式中各生成一條推理痕跡。領導榜會報告每個模型/任務配對在任一模式下所達到的最佳邊際準確率提升。

主要發現與洞見

對 30 個模型的初步評估結果揭示了關於開放式 LLM 推理能力的多項趨勢:

  • 小模型的效能: 相對較小的模型(例如 7B 參數)也能展現有效的 CoT 推理。在某些情況下,像 Phi-2 這樣的小模型在 CoT 痕跡上獲得的準確率提升甚至超過較大的模型如 Mixtral。
  • 微調的影響: 指令微調與聊天微調顯著提升表現。微調同時提升基線準確率(無 CoT)以及應用 CoT 時的邊際提升。
  • CoT 效果的不一致性: 並不存在普遍優於其他的 CoT 生成模式。策略的效能因模型與任務而異,且在某些情況下,CoT 甚至會降低準確率,顯示要打造穩健且可靠的 CoT 實作仍是一大挑戰。

未來發展與貢獻

Hugging Face 正在徵求社群貢獻,以在以下多個領域擴充領導榜:

  • 模型提交: 可透過領導榜 HF space 上的 Submission 分頁提交開放式 LLM 以供評估。
  • 分析工具: 開發 Open CoT Dashboard,以視覺化基線準確率、變異以及推理痕跡屬性(例如長度)。
  • 策略擴充: 實作額外的 CoT 模式,如思考樹、Self‑Consistency、Self‑Check 或辯論等。
  • 資料集擴充: 隨著計算資源允許,加入更具挑戰性的推理任務。

Sources