PopuLoRA: 透過共進化自我對抗打破LLM推理的局部最大值

在大型語言模型(LLM)中追求進階推理時,常會遇到稱為人類專業知識局部最大值的天花板。當模型僅依賴人類生成的資料或透過單一代理自我對抗進行訓練時,它們傾向於自我校準——基本上只是學習解決它們已經知道如何解決的問題,而不是推展自身能力的邊界。

PopuLoRA 提出了一種旨在打破此循環的新穎框架。透過從單一代理方法轉變為基於族群的非對稱自我對抗系統,PopuLoRA 建立了一種共進化的「軍備競賽」,迫使模型探索更複雜的問題空間,並在數學和編程基準測試中達成更高的推理表現。

PopuLoRA 的架構

在其核心,PopuLoRA 是一種用於可驗證獎勵強化學習(RLVR)的基於族群的非對稱自我對抗框架。與傳統的單一模型互鬥的 RL 訓練不同,PopuLoRA 利用一群建立在共享、凍結基礎模型之上的專門 LoRA(低秩適應)適配器。

教師和學生

該框架將族群劃分為兩個主要角色:

  • 教師: 這些適配器負責提出問題。
  • 學生: 這些適配器嘗試解決教師提出的問題。

這些角色是非對稱的。程式驗證器確保問題可解且學生的答案正確。此處的關鍵創新是在子族群之間使用交叉評估。這取代了單一代理自我對抗中常見的標準自我校準,其中模型通常會生成它可以可靠解決的簡單問題以最大化其獎勵。

權重空間演化

為維持族群,PopuLoRA 使用一系列 LoRA 權重空間演化運算子。這些運算子執行突變和交叉——這些概念源自演化算法——以在幾秒內產生相同等級的新族群成員。這使系統能夠在不經歷完整模型重新訓練的計算昂貴過程下,快速迭代並演化適配器的權重。

推動共進化軍備競賽

在單一代理基線中,模型常會陷入一個陷阱:它生成簡單問題,解決它們,並獲得獎勵。這會形成一個回饋迴路,使模型在中等表現水平上穩定。

PopuLoRA 透過營造共進化環境來打破這種情況。隨著學生在解決問題方面變得更好,教師會被激勵生成越來越複雜且具挑戰性的問題來測試他們。這產生了一種動態:

  1. 教師生成更複雜的問題。
  2. 學生的解題率在面對新挑戰時會波動。
  3. 問題空間的覆蓋範圍在訓練過程中持續擴展。

效能與基準測試

PopuLoRA 在 7B 規模的 Absolute Zero Reasoner 基礎上被實例化。與計算匹配的單一代理基線進行比較時,結果顯著。儘管訓練時間的獎勵較低(因為問題更難),族群平均在廣泛的基準測試中顯著優於基線:

  • 編程: HumanEval+, MBPP+, 和 LiveCodeBench。
  • 數學: AIME 24/25, AMC 23, MATH-500, Minerva, GSM8K, 和 OlympiadBench。

值得注意的是,研究人員發現,即使是演化族群中最弱的成員在總體上也優於單一代理基線,這顯示了基於族群方法的穩健性。

關鍵觀點與技術辯論

PopuLoRA 的引入引發了關於其術語和實施的技術討論。一些批評者質疑該框架是否嚴格遵循演化算法的正式語言。

"對於一種自稱是演化算法的方法,它缺少該領域的所有正式語言。沒有提到適應度函數……或選擇運算子。"

作為回應,作者澄清 LoRA 權重空間運算子作為基於族群訓練循環中的替換步驟。透過利用 RLVR 和程式驗證器,該系統有效地實施了一種基於生成和解決可驗證問題的能力的選擇過程。

關於族群混合的效率,也有持續的討論。一些觀察者質疑,1-Teacher/1-Student (1T-1S) 配置在某些任務上是否可能優於更大的族群(例如 4T-8S),這將挑戰這樣的前提:較大的族群混合是改進的主要驅動力。然而,核心主張仍然是,由族群提供的共進化壓力——而非單一代理——才能防止模型陷入「簡單問題」的陷阱。

Sources