OpenAI 解決數學應用題與 GSM8K 資料集

OpenAI 開發了一套系統,能夠解決小學數學應用題,其準確度幾乎是微調後的 GPT-3 模型的兩倍。該系統在一個新的基準測試中達到了 55% 的成功率,表現約為 9-12 歲兒童樣本(在相同測試中得分 60%)水準的 90%。

克服多步驟推理失敗

像 GPT-3 這樣的大型語言模型通常在需要精確多步驟推理的任務中感到吃力。雖然這些模型可以模仿正確數學解法的風格和節奏,但它們經常犯下關鍵的邏輯錯誤。由於自回歸模型是按順序生成 token,它們缺乏一種原生機制來在錯誤發生後進行修正;單一錯誤往往會導致剩餘的解法無法挽回。

為了應對這一點,OpenAI 實施了一套驗證系統,讓模型能夠識別自己的錯誤並進行迭代,直到找到正確的解法。

GSM8K 資料集

為了評估並促進數學推理的研究,OpenAI 發布了 GSM8K 資料集。

資料集特性

  • 組成成分:8.5K 個高品質小學數學應用題。
  • 複雜度:每個問題需要 2 到 8 個步驟來解決。
  • 運算:解法依賴於基礎算術運算,包括加法、減法、乘法和除法。
  • 格式:解法是以自然語言而非純數學表達式編寫的,這使得它們對人類來說更具可解釋性,且該方法更具領域無關性。

OpenAI 指出,雖然 GSM8K 中的概念是基礎的,但問題的高度多樣性導致最先進的微調語言模型表現不佳。

訓練驗證器以進行錯誤修正

OpenAI 通過訓練驗證器來評估提議的解法是否正確,從而提高了性能。該系統不再依賴單一輸出,而是針對給定問題生成 100 個候選解法,並使用驗證器來選擇排名最高的候選解法。

驗證的關鍵發現

  • 效率:驗證通常比生成任務更簡單,當資料集足夠大時,能提供強大的性能提升。
  • 擴展性:在完整的訓練集上,一個使用驗證機制的 6B 參數模型略微優於微調後的 175B 參數模型。這表明驗證機制提供的性能提升大約相當於模型規模增加 30 倍。
  • 過擬合風險:如果資料集太小,驗證器可能會因為背誦最終答案而非學習數學推理的底層屬性而導致過擬合。

對通用人工智慧的啟示

能夠產生正確的論點並識別錯誤的論點,是通用人工智慧的基本要求。小學數學可以作為理想的測試平台,因為這些問題在概念上很簡單,但對細微錯誤非常敏感。通過訓練模型將成功的解法與失敗的嘗試區分開來,OpenAI 的目標是開發未來適用於更複雜邏輯領域的技能。

Sources