LittleLearner: 透過教學控制暴露來測試 LLM 的知識邊界

預訓練數據設定了有效能力天花板

LittleLearner 研究專案確立了預訓練分佈定義了語言模型能力的上限。在模型僅針對 K-5(幼兒園至五年級)課程進行訓練的實驗中,無論是擴展模型規模、應用後訓練強化學習(GRPO),還是使用上下文學習(in-context learning),都無法顯著提升模型在需要超出五年級水平的知識或推理任務上的表現。這表明,進階能力並非僅僅是從模型中被引發(elicited),而是從根本上在預訓練階段獲得的。

LittleLearner 實驗框架

為了隔離「技能是學習到的還是被引發的」這一問題,研究人員透過限制訓練分佈來創建了一個受控的沙盒。

LittleCurriculum 數據集

該專案的基礎是 LittleCurriculum,一個從 FineWeb-Edu 蒸餾而來的 88B-token 語料庫。研究人員使用了一套與美國 Common Core 標準對齊的五階段過濾流程,以明確排除五年級以上所教授的概念、事實和詞彙。

模型架構

研究人員從這個過濾後的語料庫中從頭開始訓練了三種規模的 LittleLearner 模型:0.6B、1.3B 和 5B 參數。為了確保公平比較,每個規模都包含一個匹配的「未過濾」(Unfiltered)對照模型,該模型共享相同的架構、token 數量和訓練方案,但是在未過濾的數據集上進行訓練的。

模型變體

  • Base: 原始預訓練模型。
  • GRPO: 在 MathCAMPS 上進行後訓練的數學專家模型,用以測試 RL 是否能彌補知識差距。
  • Chatty: 針對一般對話行為進行微調的變體。

關鍵發現:引發 vs. 獲取

研究的核心發現是,標準的干預措施可以放大現有的範圍內能力,但無法解鎖範圍外的能力。

規模擴展限制

增加模型規模可以提升 K-5 知識邊界內的表現,並略微擴展到具有相同學習軌跡的問題上。然而,對於需要超出預訓練暴露範圍之外的進階能力問題,擴展規模幾乎沒有改善。

後訓練與 RL

透過 Group Relative Policy Optimization (GRPO) 進行的後訓練顯著提升了 K-5 任務的表現。然而,即使 RL 訓練涉及範圍外的數據,它也無法恢復超出 K-5 的能力。這表明預訓練過濾器設定了一個後訓練無法穿透的天花板。

上下文學習 (ICL)

對於 5B 的 LittleLearner 模型,上下文學習提示詞並未為超出 K-5 的任務解鎖新的推理能力,證實了模型缺乏處理進階查詢所需的底層表徵知識。

未來研究方向

由於知識邊界被明確定義,LittleLearner 可作為多個研究方向的工具:

  • RL 與發現: 測試 RL 是否能創造出訓練數據中原本不存在的全新能力。
  • 持續學習: 在向具有已知邊界的模型引入新概念(例如:負數)時,衡量樣本效率和干擾。
  • 教育科學: 將機器學習軌跡與人類兒童的發展進行比較,以觀察模型和兒童是否需要相似的暴露來學習特定概念(如:分數)。

社群分析與評論

技術觀察者之間的討論突出了關於模型行為以及過濾流程有效性的幾個要點:

模型失效模式

報告與 Demo 互動的使用者觀察到,當被提示超出範圍的主題時,會出現顯著的幻覺和「循環」行為。例如,一位使用者指出,當被問及量子重力時,模型反覆說道:「地球的重力場一直在變化。」

「成人對兒童」的人格特質

一些評論家認為,模型可能學到的是教學材料的 風格,而非嚴格的知識邊界。一位觀察者指出:

頁面上的樣本讀起來更像是模型學會了如何模擬一個大人對小孩說話的模式……模型只是變得更擅長模仿大人向下俯視說話的口吻。

數據洩漏疑慮

對於 K-5 過濾器的絕對純度存在疑慮。一些使用者指出,模型能夠解釋瑞利散射(Rayleigh scattering,天空變藍的原因)這一點,證明了過濾器可能讓五年級以上的材料流出。

對前沿模型的啟示

一些觀察者認為,這些結果對前沿 AI 實驗室來說是「慘淡」的,這表明智能並非僅僅是規模擴展的湧現屬性,而是受到攝入數據的質量和範圍的嚴嚴格限制。這意味著通往 AGI 的路徑可能更多地取決於數據策劃,而非架構擴展。

Sources

相關