現代 LLM 中推理能力與知識儲存之間的權衡

AI 實驗室正優先考慮推理而非事實回憶

現代大型語言模型 (LLM) 展現出一種矛盾的趨勢:在 AIME 等基準測試中的推理分數正在攀升,而每個 token 的活躍參數數量卻在減少。例如,GLM-5.2 在 AIME 2026 上取得了 99.2% 的分數,僅使用了約 400 億個活躍參數;而 Qwen3.5 在使用 170 億個活躍參數的情況下取得了 91.3% 的分數。相比之下,2023 年據報導使用約 2800 億個活躍參數的 GPT-4,在處理類似問題時卻顯得吃力。

雖然推理效率正在提高,但事實回憶能力卻在下降。在測試不使用工具進行事實回憶的 SimpleQA 基準測試中,領先者 (Gemini 2.5 Pro) 仍會遺漏大約一半的問題。較小的模型,如 Qwen3.5 4B 和 9B,在知識基準測試中顯示出 80% 到 82% 的幻覺率。這表明 AI 實驗室正在進行一種刻意的設計選擇,即以犧牲世界知識來換取推理能力。

事實與推理的計算成本差異

事實知識需要龐大的參數空間,據估計每個參數大約需要兩位元的知識量。儲存詳盡的細節——例如無名歷史人物的出生年份或特定的 API 參數順序——需要數兆個參數。

然而,推理能力更具壓縮性,因為它由一組可重複的程序組成:將問題分解、追蹤中間狀態以及在失敗時進行回溯。透過在可驗證任務上進行蒸餾 (distillation) 和強化學習,可以將這些程序轉移到較小的模型中。例如,Phi-4 (140 億參數) 精通數學但對瑣事知識表現不佳,這反映了其訓練重點在於合成的教科書式數據,而非廣泛的世界知識。

將靜態權重與動態事實解耦

將事實寫死在模型權重中是低效的,因為資訊會過時。API 規範、定價和人員變動頻常發生,這意味著模型的知識在訓練結束的那一刻就開始陳舊。相比之下,推理程序(如代數或邏輯矛盾檢測)是永恆不變的。

透過將昂貴且訓練緩慢的模型與快速變化的世界狀態解耦,開發者可以創建出不會像知識密集型模型那樣迅速老化模型的。目標是創建一個扮演通用型角色(角色足以理解查詢並判斷來源的可信度)的模型,而將深度知識留給運行時 (runtime) 檢索。n

在知識檢索中「套件」的角色

為了補償內部知識的缺乏,模型依賴於一個「套件」(harness):一個由檢索增強生成 (RAG)、工具調用、網絡搜索或本地文件系統訪問權限組成的系統。在這種架構下,模型提供推理引擎,而具體的事實則在運行時提供。

這種方法對於編碼代理 (coding agents) 特別有效。代理不需要背誦整個函式庫的 API 介面,而是可以透過 grep node_modules 或閱讀當前文檔,確保答案是基於實際安裝的版本,而非訓練數據中存在的版本。

對幻覺與本地部署的影響

將事實從權重中移出並放入「套件」中,改變了幻覺的性質。當事實儲存在權重中時,若發生錯誤的事實,若不進行全量微調,幾乎不可能找到或修復。當事實存在於外部知識庫時,錯誤的答案會有一個特定的地址(一個被引用的文檔)。如果文檔內容不正確,可以直接進行編輯,且修正後的內容會立即對所有未來的查詢可用。n

這項轉變也使得前沿水準的推理能力可以在消費級硬體上運行。如果剝離了知識密集型的專家層,一個 200 億到 400 億參數的模型(在 4-bit 量化下)可以裝進 24GB VRAM 的 GPU,前提是該模型配備了強大的外部「套件」進行事實檢索。

批判性觀點與反對意見

雖然將推理與知識解耦的趨勢在概念上很有吸引力,但它面下面臨著幾個技術和哲學上的挑戰:

  • 推理與知識的相互依賴性: 有些人認為推理不能完全從語義內容中分離。為了推理關於人類行為或歷史事件,模型必須具備一定的基礎事實知識來支撐其邏輯。

  • RAG 的局限性: 批評者指出,將資訊移至上下文窗口 (context window) 並不會自動消除幻覺。模型仍可能誤讀來源或錯誤地綜合多份文檔。n

  • **Data Quality: 批評者指出,將資訊移至上下文窗口 (context window) 並不會自動消除幻覺。模型仍可能誤讀來源或控制對外部搜索工具的品質。如果搜索引擎品質下降或檢索到的文檔內容不正確,模型的推理能力無法補償缺乏事實先驗知識的缺點。

  • Benchmark Validity: 社會群體成員指出,某些基準測試(如 SimpleQA)可能已經過時,這表明關於當前回憶能力領先者的聲明,可能無法反映最新的模型迭代版本。

}

Sources

相關