OpenAI 学习使用 LLM 进行推理

OpenAI 发布了一项技术演示,展示了大型语言模型(LLM)如何被训练以在复杂的多步骤问题中进行推理。通过提供模型破解密码的详细内部独白,OpenAI 阐明了从最初观察到假设检验再到最终验证的过程。

通过逐步推理解决复杂密码

演示的核心是让模型基于单一提供的示例解码密文。该过程突显了模型执行迭代逻辑推理的能力,这正是现代 LLM 所具备的“推理”特征。

问题描述

模型的任务是根据示例映射 oyfjdnisdr rtqwainr acxz mynzbhhx → 明文 Think step by step,解码短语:oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz

逻辑推理过程

模型通过结构化的观察与测试序列得出解决方案:

  1. 模式识别:模型首先注意到密文字词的长度恰好是明文字词的两倍(例如密文 10 个字母对应明文 5 个字母)。
  2. 假设形成:模型假设每个明文字母由一对密文字母表示。
  3. 数学验证:模型通过将字母转换为字母表中的数值位置(A=1,B=2,…)来测试映射,发现密文字母对的数值平均值等于对应明文字母的数值。
    • 示例:对于字母对 oy(o=15,y=25),其和为 40,平均值为 20,对应字母 T
  4. 一致性检查:模型在示例短语(Think step by step)的所有单词中验证此规则,确认密码的数学一致性。

最终解码与结果

一旦推理链建立,模型将发现的规则应用于目标密文。它将目标字符串拆分为对并计算平均值以得到明文。

  • 单词 1oyekaijzdf $ ightarrow$ THERE
  • 单词 2aaptcg $ ightarrow$ ARE
  • 单词 3suaokybhai $ ightarrow$ THREE
  • 单词 4ouow $ ightarrow$ RS
  • 单词 5aqht $ ightarrow$ IN
  • 单词 6mynznvaatzacdfoulxxz $ ightarrow$ STRAWBERRY

最终解码信息:"THERE ARE THREE R'S IN STRAWBERRY"

对 AI 推理的意义

本演示作为概念验证,展示了模型处理超出简单模式匹配任务的能力。通过显式地“思考”问题——测试假设、遇到矛盾并纠正方向——模型展现出一种系统性的问题解决能力,模拟了人类的认知过程。

Sources