OpenAI 透過過程監督提升數學推理
OpenAI 透過實施過程監督,在數學問題解決上達到了新的最先進水平。過程監督是一種方法,它會對模型的每一個正確推理步驟給予獎勵,而不僅僅獎勵正確的最終答案。這種方法不僅提升了數學表現,也透過訓練模型產生人類認可的思考鏈來改善 AI 對齊。
過程監督 與 結果監督
過程監督會對思維鏈中的每一個單獨步驟提供回饋,而結果監督則僅基於最終結果提供回饋。這種區別對於減輕「幻覺」——即使在最先進的大型語言模型中也會發生的邏輯錯誤——至關重要。
透過獎勵過程,模型會直接被訓練去遵循人類認可的邏輯路徑。相對地,結果監督可能會不經意地獎勵一個不符合對齊或不正確的推理過程,該過程恰好得出正確的最終答案,這使得檢視變得更困難且可靠性降低。
對 AI 對齊和「對齊稅」的影響
過程監督為 AI 對齊提供了幾項明顯的優勢:
- 可解讀的推理: 因為模型被鼓勵遵循人類認可的過程,產生的推理鏈更具可解讀性。
- 直接對齊: 推理過程的每一步都會獲得精確的監督,確保模型遵循一個對齊的思考鏈。
- 負向對齊稅: 通常,實施更安全的 AI 方法會導致效能下降,這種現象被称为「對齊稅」。然而,在數學領域,過程監督會產生「負向對齊稅」,意謂著它實際上提升了模型的能力,同時改善了對齊。
MATH 數據集的效能基準
OpenAI 使用 MATH 測試集評估了過程監督和結果監督的獎勵模型。評估過程包括為每個問題生成多個解答,並選擇由各自獎勵模型排名最高的解答。
主要發現包括:
- 更高的準確度: 過程監督的獎勵模型在所有測試場景中均優於結果監督的獎勵模型。
- 可靠性提升: 隨著每個問題考慮的解答數量增加,兩種方法之間的效能差距擴大,這表明過程監督的獎勵模型在辨識正確推理路徑方面更可靠。
案例研究:複雜三角函數
為了展示獎勵模型的有效性,OpenAI 凸顯了一個涉及化簡 $ an 100^{\circ} + 4 \sin 100^{\circ}$ 的具有挑戰性的三角函數問題。
雖然 GPT-4 通常在這個特定問題上會遇到困難——只有 0.1% 的解答嘗試能得到正確答案——但過程監督的獎勵模型能夠正確識別出一個有效的解答。該有效解答需要一個複雜的 26 步三角恆等式與化簡序列,才能得到正確答案 $-\sqrt{3}$。
未來研究方向
雖然這些結果對數學推理具有重要意義,但 OpenAI 指出目前尚不清楚過程監督在其他領域的泛化範圍有多廣。未來研究將集中在探索此方法是否能在非數學任務中提供類似的效能提升與對齊改善的組合。