OpenAIがLLMで推論を学ぶ
OpenAIは、巨大言語モデル(LLMs)が複雑で多段階の問題を通じて推論できるように訓練できることを示す技術デモンストレーションを公開しました。暗号を解くモデルの詳細な内部モノローグを提供することで、OpenAIは最初の観察から仮説検証、最終的な確認へと移行する過程を示しています。
ステップバイステップの推論による複雑な暗号の解読
デモンストレーションの核心は、単一の提供された例に基づいて暗号文をデコードするモデルです。このプロセスは、モデルが反復的な論理的推論を行う能力を強調しており、これは現代のLLMにおける「推論」の特徴です。
問題文
モデルは、例のマッピング oyfjdnisdr rtqwainr acxz mynzbhhx を平文 Think step by step に対応させることに基づき、フレーズ oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz をデコードする課題が与えられます。
論理的推論プロセス
モデルは、観察とテストの構造化された一連の手順を通じて解決策にたどり着きます:
- パターン認識: モデルはまず、暗号文の単語が平文の単語のちょうど2倍の長さであること(例:暗号文は10文字、平文は5文字)を観察します。
- 仮説形成: 各平文文字が暗号文字のペアで表されていると仮定します。
- 数学的検証: モデルは文字をアルファベットの数値位置(A=1、B=2、…)に変換してマッピングをテストします。暗号文字ペアの数値の平均が平文文字の数値に等しいことを発見します。
- 例: ペア
oy(o=15、y=25)の合計は40で、平均は20であり、これは文字Tに対応します。
- 例: ペア
- 一貫性チェック: モデルは例文(
Think step by step)のすべての単語に対してこの規則を検証し、暗号の数学的一貫性を確認します。
最終的なデコードと結果
推論チェーンが確立されると、モデルは発見した規則を対象の暗号文に適用します。対象文字列をペアに分割し、平均を計算して平文を導き出します。
- 単語1:
oyekaijzdf$ ightarrow$THERE - 単語2:
aaptcg$ ightarrow$ARE - 単語3:
suaokybhai$ ightarrow$THREE - 単語4:
ouow$ ightarrow$RS - 単語5:
aqht$ ightarrow$IN - 単語6:
mynznvaatzacdfoulxxz$ ightarrow$STRAWBERRY
最終デコードメッセージ: "THERE ARE THREE R'S IN STRAWBERRY"
AI推論への示唆
この手順は、単なるパターンマッチング以上を必要とするタスクを処理できるモデルの能力の概念実証として機能します。問題を明示的に「考える」—仮説をテストし、矛盾に直面し、方針を修正することで、モデルは人間の認知プロセスを模倣した体系的な問題解決能力を示しています。
Sources
- OriginalLearning to reason with LLMs