GPT-6 Astra: 循环 Transformer 与关于隐藏推理的争论
GPT-6 Astra 代表了多模态能力的重大飞跃,特别是在 3D 渲染、动画和通用计算机使用方面。虽然 OpenAI 尚未正式确认其架构,但证据和行业报告表明,该模型利用“循环 Transformer”(或循环深度)来增强推理性能,同时保持可控的参数占用。
高级计算机使用与训练基础设施
GPT-6 Astra 展示了与图形用户界面 (GUI) 交互的高超能力,使其能够通过 Codex/ChatGPT app 在本地计算机上操作软件。这种能力可以通过其执行复杂任务的能力得到证明,例如在 Blender 中渲染纽约市,或使用 MS Paint 通过模拟鼠标光标来重绘图像。
这种“计算机使用”能力是通过涉及可验证奖励强化学习 (RLVR) 的特定训练工作流实现的:
- 任务提示:向模型提供一个目标(例如,“打开 app X 并执行 Y”)。
- 视觉反馈:训练框架提供操作系统界面的截图。
- 动作预测:LLM 预测鼠标和键盘动作。
- 执行:训练框架在操作系统上执行这些动作。
- 迭代循环:过程通过新的截图重复进行,直到任务成功或失败。
为了支持这一点,据报道 OpenAI 购买了数万台 Mac Mini 和 Mac Studio,作为模型学习 macOS 交互的环境,而实际的模型训练则是在大约 100,000 台 NVIDIA Grace Blackwell GPU 上进行的。
理解循环 Transformer
循环 Transformer 是一种架构修改,其中中间表示被多次传递通过相同的 Transformer 块。与通过增加更多不同的层来增加深度的传统 Transformer 不同,循环 Transformer 重用现有块的权重。
关键架构变体
- 固定循环 (例如, Nanbeige4.2-3B):模型将一叠 Transformer 块以固定次数(例如,两次传递)应用。这增加了有效深度(例如,从 22 个块应用增加到 44 个),而无需增加需要存储在内存中的参数数量。
- 自适应停止 (例如, Universal Transformers):模型使用学习到的函数为每个 token 输出一个“停止概率”。一旦累积概率超过阈值,循环就会停止,这允许模型为困难的 token 分配更多计算量。
- 混合递归 (MoR):路由程序决定一个 token 通过共享堆栈的次数。这可以通过 专家选择路由(由步骤选择 token)或 token 选择路由(路由程序在开始时分配路径)来实现。
- 潜空间推理 (Latent Reasoning):一些变体在初始块和最终块之间夹入一个共享堆栈,在每次循环开始时将初始表示反馈回堆栈,以提供一个恒定的参考点。
计算权衡
虽然循环 Transformer 通过减少不同权重的数量来节省 GPU 显存,但它们并不会减少前向传播的计算成本。运行一个块两次所需的计算量与运行两个不同的块相同。此外,它们不会减少 KV cache 的需求;因为不同传递之间的中间状态不同,每次传递都需要自己的 KV cache 条目。
“隐藏推理”争议
来自 The Information 的报告表明,Astra 使用的循环深度允许它“隐藏”其推理轨迹(思维链),引发了安全性和可解释性方面的担忧。然而,技术分析表明,循环并不是掩盖推理的主要机制。
推理轨迹 vs. 潜空间计算
推理模型通常使用外部 token 的“草稿本”来思考。循环 Transformer 增加了每个 token 的 内部 计算量。虽然更强大的模型(如 Astra)可能会因为更高效或犯错更少而产生更短的外部推理轨迹,但这反映了智能的提升,而不一定是刻意的架构设计试图隐藏逻辑。
行业观点
OpenAI 首席科学家 Jakub Pachocki 澄清,Astra 的计算图深度在 GPT-4 的两倍以内,并强调 OpenAI 继续优先考虑思维链监控以实现对齐,他指出,虽然监控能力正在“呈现负面趋势”,但这并不取决于架构的变化。
社区反驳观点
一些研究人员和用户认为,向潜空间推理的转变(在隐藏状态中处理更多内容,而不是在文本中)本质上降低了监控能力。
"当更多处理发生在潜空间内而不输出文本时,这意味着更有效、频繁的思维链监控减少了,并且存在更大的未受监控的潜空间行为的可能性。"
性能与缩放定律
最近的研究,例如 SMELT 论文(2026 年 9 月),表明循环 Transformer 是计算高效的的。通过缩小隐藏层维度以补偿额外的块应用,并添加专家 (MoE) 来恢复参数量,SMELT 模型在达到与传统 Transformer 相同的验证损失时,比传统 Transformer 需要更少的训练计算量 (6.8-18%)。
此外,关于“虚拟逻辑深度”的研究表明,虽然循环循环并不增加模型存储信息的能力(记忆力),但它在不增加新参数的情况下,显著提升了多步推理任务的性能。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch