为什么对于现代 LLM 而言,“下一个 Token 预测器”这一心理模型是不完整的
下一个 Token 预测器模型的局限性
虽然大语言模型 (LLMs) 在推理时作为下一个 Token 预测器运行——逐个发射 Token——但这种描述对于现代模型是如何训练的以及它们编码了什么来说,是一个不完整的心理模型。“下一个 Token 预测器”这一标签准确地描述了输出的机制(推理循环的形式),但它未能捕捉到后训练 (post-trained) 模型的目标。
预训练 vs. 后训练目标
基座模型学习的方式与后训练模型通过强化学习演进的方式之间存在根本区别。
预训练:模仿与预测
在预训练期间,模型充当传统的下一个 Token 预测器。它分析训练数据集中的现有序列,并调整其参数,使该序列中实际的下一个 Token 更有可能被采样。其目标纯粹是预测性的:模型学习模仿其训练数据的统计模式。
后训练:通过 RLVR 实现奖励最大化
现代 LLMs 会经历后训练,特别是带有可验证奖励的强化学习 (Reinforcement Learning with Verifiable Rewards, RLVR)。在 RLVR 中,模型并没有一个来自数据集的“正确”下一个 Token 可供预测。相反,它通过生成新序列来进行探索,并根据结果获得奖励。
在这种范式下,模型使某个 Token 的概率增加,并不是因为它出现在训练集中,而是因为包含该 Token 的序列带来了高奖励。其目标从预测数据中的下一个 Token转向了最大化奖励函数。
国际象棋类比:预测 vs. 优化
为了说明模仿与优化的区别,请考虑两种类型的国际象棋系统:
- 下一个移动预测器: 一个在特级大师对局数据库上训练的系统。它预测特级大师在给定位置最有可能下的棋步。它仅限于模仿现有的真人对局。
- 奖励最大化器: 一个理想化的引擎,它探索所有可能的对局来确定从任何位置获胜的概率。它选择能使获胜概率最大化的移动,无论人类是否曾经下过那一招。
将第二个系统称为“下一个移动预测器”是有误导性的,因为其目标不是预测一个数据集,而是在比赛中获胜。
社区观点的综合
技术从业者的讨论揭示了对于“下一个 Token 预测器”这一标签是根本错误还是仅仅是一个抽象层级的问题,存在着深刻的分歧。
支持该模型有效性的论点
有些人认为,无论训练目标是什么(RLVR 或预训练),数学运算仍然是相同的:计算条件概率 $P(\text{token}k | \text{tokens}{1...k-1})$。
"The mechanism used to do that doesn't matter, it's still predicting the next token whether that's because it maximises a reward or because it follows a gradient or whatever else one might think."
其他人建议,“下一个 Token 预测器”模型对于解释常见的 LLM 失败模式很有用,例如在回答的早期阶段“锁定”在错误答案上,因为模型无法自我编辑之前已发射的 Token。
反对该模型有效性的论点
该标签的批评者认为,它经常被用作一种“还原论”工具,以忽视 LLM 的涌现能力。他们认为,仅仅关注逐个 Token 的机制忽略了为了使这些预测准确而必须形成的复杂内部表示和“世界模型”。
"It's like saying a Boeing 777 is just a rotating machine, and it flies by just rotating some fins. Well yes, but no. With that level of simplification we've just ignored 150 tons of advanced engineering and physics."
涌现与智能体系统
有些人认为,“下一个 Token 预测器”是基础组件,但由此产生的系统是更高级的东西。在这种观点下,现代 AI 是一个涌现系统,其中简单的规则(Token 预测)和复杂的交互(RLVR, 工具使用, 递归调用)创造了超越简单预测器标签的能力。
Sources
相关
- Dispatch
- 项目
- 项目
- Dispatch
- Dispatch