OpenAI 学习使用 LLM 进行推理
OpenAI 发布了一项技术演示,展示了大型语言模型(LLM)如何被训练以在复杂的多步骤问题中进行推理。通过提供模型破解密码的详细内部独白,OpenAI 阐明了从最初观察到假设检验再到最终验证的过程。
通过逐步推理解决复杂密码
演示的核心是让模型基于单一提供的示例解码密文。该过程突显了模型执行迭代逻辑推理的能力,这正是现代 LLM 所具备的“推理”特征。
问题描述
模型的任务是根据示例映射 oyfjdnisdr rtqwainr acxz mynzbhhx → 明文 Think step by step,解码短语:oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz。
逻辑推理过程
模型通过结构化的观察与测试序列得出解决方案:
- 模式识别:模型首先注意到密文字词的长度恰好是明文字词的两倍(例如密文 10 个字母对应明文 5 个字母)。
- 假设形成:模型假设每个明文字母由一对密文字母表示。
- 数学验证:模型通过将字母转换为字母表中的数值位置(A=1,B=2,…)来测试映射,发现密文字母对的数值平均值等于对应明文字母的数值。
- 示例:对于字母对
oy(o=15,y=25),其和为 40,平均值为 20,对应字母T。
- 示例:对于字母对
- 一致性检查:模型在示例短语(
Think step by step)的所有单词中验证此规则,确认密码的数学一致性。
最终解码与结果
一旦推理链建立,模型将发现的规则应用于目标密文。它将目标字符串拆分为对并计算平均值以得到明文。
- 单词 1:
oyekaijzdf$ ightarrow$THERE - 单词 2:
aaptcg$ ightarrow$ARE - 单词 3:
suaokybhai$ ightarrow$THREE - 单词 4:
ouow$ ightarrow$RS - 单词 5:
aqht$ ightarrow$IN - 单词 6:
mynznvaatzacdfoulxxz$ ightarrow$STRAWBERRY
最终解码信息:"THERE ARE THREE R'S IN STRAWBERRY"
对 AI 推理的意义
本演示作为概念验证,展示了模型处理超出简单模式匹配任务的能力。通过显式地“思考”问题——测试假设、遇到矛盾并纠正方向——模型展现出一种系统性的问题解决能力,模拟了人类的认知过程。
Sources
- OriginalLearning to reason with LLMs