OpenAI 學習以 LLM 進行推理
OpenAI 發布了一個技術示範,展示大型語言模型(LLM)如何被訓練以在複雜的多步問題中進行推理。透過提供模型解密密碼的詳細內部獨白,OpenAI 說明了從最初觀察到假設測試再到最終驗證的過程。
透過逐步推理解決複雜密碼
此示範的核心是模型根據單一提供的範例解碼密文。此過程凸顯了模型執行迭代式邏輯推理的能力,這是現代 LLM 中「推理」的標誌。
問題說明
模型的任務是根據範例映射 oyfjdnisdr rtqwainr acxz mynzbhhx 對應明文 Think step by step,解碼以下短語:oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz。
邏輯推理過程
模型透過結構化的觀察與測試序列得出解答:
- 模式辨識:模型首先觀察到密文字詞的長度恰好是明文字詞的兩倍(例如,密文 10 個字母對應明文 5 個字母)。
- 假設形成:它假設每個明文字母由一對密文字母表示。
- 數學驗證:模型透過將字母轉換為字母表中的數值位置(A=1、B=2,依此類推)來測試映射。它發現密文字母對的數值平均值等於明文字母的數值。
- 例子:對於字母對
oy(o=15,y=25),總和為 40,平均值為 20,對應的字母為T。
- 例子:對於字母對
- 一致性檢查:模型在範例短語(
Think step by step)的所有單詞中驗證此規則,確認密碼的數學一致性。
最終解碼與結果
一旦推理鏈建立完成,模型便將發現的規則套用於目標密文。它將目標字串切分為兩兩一組,計算平均值以推導出明文。
- 單詞 1:
oyekaijzdf$ ightarrow$THERE - 單詞 2:
aaptcg$ ightarrow$ARE - 單詞 3:
suaokybhai$ ightarrow$THREE - 單詞 4:
ouow$ ightarrow$RS - 單詞 5:
aqht$ ightarrow$IN - 單詞 6:
mynznvaatzacdfoulxxz$ ightarrow$STRAWBERRY
最終解碼訊息:"THERE ARE THREE R'S IN STRAWBERRY"
對 AI 推理的啟示
此步驟說明作為概念驗證,證明模型能處理超越簡單模式匹配的任務。透過明確「思考」問題——測試假設、遭遇矛盾並修正方向——模型展示了類似人類認知過程的系統性問題解決能力。
Sources
- OriginalLearning to reason with LLMs