OpenAI Neural GPU: 擴展與限制
OpenAI 已經增強了 Neural GPU,這是一種能學習多位元二進位加法和二進位乘法等演算法的模型,該模型能泛化到任意長度的輸入。透過實施精心設計的課程並增加模型規模,研究人員發現 Neural GPU 現在能解決更廣泛的演算法問題,包括使用十進位表示的算術運算。
透過課程與模型規模提升效能
The Neural GPU 學習複雜演算法的能力是泛化。研究人員確定了兩種主要方法來提升其性能:
課程學習: 精心設計訓練課程使模型能更有效地學習任務。
增加模型規模: 增加模型規模能提升其解決更多演算法問題的能力。然而,這需要記憶體效率高的實作,因為 Neural GPU 的天真實作會消耗大量記憶體。
擴充的演算法能力
透過這些改進,Neural GPU Neural GPU 現在可以執行以下任務:
十進位算術: 模型現在可以學習執行所有算術運算,並在採用十進位表示的參數時推廣到任意長度的數字。這之前是不可能的。
算術表達式: Neural GPU 可以被訓練來評估含有多個運算元且需要遵守運算元優先順序的長算術表達式。這些任務僅在二進位表示下成功,且未達到完美準確性。
失效模式與類對抗行為
儘管在長數字上達成了近乎完美的泛化,Neural GPU 在非典型、高度對稱的輸入上仍會表現出特定的失效模式。這些失效模式類似於對抗範例。
例如,一個能成功將 2x2 相乘的 Neural GPU,在計算 000000…002 x 000000…002 的正確答案時會失敗,儘管它已成功接受過最多 100 位數長度的十進位乘法訓練。