GPT-6 Astra: Looped Transformers and the Debate Over Hidden Reasoning

GPT-6 Astra 代表了多模態能力的重大飛躍,特別是在 3D 渲染、動畫和通用電腦使用方面。雖然 OpenAI 並未正式確認其架構,但證據和業界報導指出,該模型利用了「迴圈 Transformer」(looped transformers,或稱遞歸深度)來增強推理性能,同時保持可控的參數規模。

Advanced Computer Use and Training Infrastructure

GPT-6 Astra 展示了與圖形使用者介面(GUIs)互動的高超能力,使其能夠透過 Codex/ChatGPT app 在本地電腦上操作軟體。這種能力可以從其執行複雜任務的能力中得到證實,例如在 Blender 中渲染紐約市,或使用 MS Paint 透過模擬滑鼠游標來重新繪製圖像。

這種「電腦使用」能力是由於採用了涉及「可驗證獎勵強化學習」(Reinforcement Learning with Verifiable Rewards, RLVR)的特定訓練工作流:

  1. Task Prompting: 模型被賦予一個目標(例如,「開啟 app X 並執行 Y")。
  2. Visual Feedback: 框架提供作業系統介面的截圖。
  3. Action Prediction: LLM 預測滑鼠和鍵盤動作。
  4. Execution: 框架在作業系統上執行這些動作。
  5. Iterative Loop: 過程會帶著新的截圖重複進行,直到任務成功或失敗。

為了支持這一點,據報導 OpenAI 購買了數萬台 Mac Mini 和 Mac Studio,作為模型學習 macOS 互動的環境,而實際的模型訓練則是在約 100,000 台 NVIDIA Grace Blackwell GPUs 上進行。

Understanding Looped Transformers

迴圈 Transformer 是一種架構修改,其中中間表示(intermediate representations)會多次通過相同的 Transformer 區塊(blocks)

Key Architectural Variants

  • Fixed Looping (e.g., Nanbeige4.2-3B): 模型會以固定次數(例如,兩次通過)套用一組 Transformer 區塊。這在不增加需要儲存在記憶體中的參數數量的情況下,增加了有效深度(例如,從 22 個區塊應用次數增加到 44 次)。
  • Adaptive Halting (e.g., Universal Transformers): 模型使用一個學習到的函數來輸出每個 token 的「停止機率」(halting probability)。一旦累積機率超過閾值,迴圈就會停止,這使得模型能夠為困難的 token 進行分配更多計算量。
  • Mixture-of-Recursions (MoR): 路由(router)決定一個 token 經過共享堆疊(shared stack)的次數。這可以透過 expert-choice routing(由步驟選擇 token)或 token-choice routing(由路由在開始時分配路徑)來完成。
  • Latent Reasoning: 一些變體將共享堆疊夾在初始和最終區塊之間,在每次迴圈開始時將初始表示回饋到堆疊中,以提供一個恆定的參考點。

Computational Trade-offs

雖然迴圈 Transformer 透過減少不同權重的數量來節省 GPU 記憶體,但它們並不會減少前向傳播(forward pass)的計算成本。運行一個區塊兩次所需的計算量與運行兩個不同的區塊相同。此外,它們也不會減少 KV cache 的需求;因為不同次通過之間的中間狀態不同,每次通過都需要其自身的 KV cache 條目。

The "Hidden Reasoning" Controversy

來自 The Information 的報導指出,Astra 的遞歸深度使用讓它能夠「隱藏」其推理跡象(Chain of Thought),引發了安全性和可解釋性方面的疑慮。然而,技術分析指出,迴圈並非掩蓋推理的主要機制。

Reasoning Traces vs. Latent Compute

推理模型通常使用外部 token 的「草稿本」(scratchpad)來思考。迴圈 Transformer 增加了每個 token 的 內部 計算量。雖然能力更強的模型(如 Astra)可能會因為效率更高或錯誤更少而產生較短的外部推理跡象,但這並不一定代表其架構設計是刻意嘗試隱藏邏輯。

Industry Perspective

OpenAI 首席科學家 Jakub Pachocki 澄清,Astra 的計算圖深度是在 GPT-4 的兩倍以內,並強調 OpenAI 將繼續優先考慮 Chain-of-Thought 監控以確保對齊(alignment)。他指出,雖然監控能力正在「呈現負面趨勢」,但這並不取決於架構的變動。

Community Counterpoints

一些研究人員和用戶認為,向潛在推理(latent reasoning,即在隱藏狀態而非文本中處理更多內容)的轉向,本質上會降低監控能力。

"When more processing occurs within latent space without outputting text, that means less effective, frequent chain-of-thought monitoring, and the potential for greater un-monitored latent-space shenanigan."

Performance and Scaling Laws

最近的研究,例如 SMELT 論文(2026 年 9 月),指出迴圈 Transformer 是計算高效的。透過縮小隱藏維度以補償額外的區塊應用,並增加專家(MoE)來恢復參數數量,SMELT 模型在達到與傳統 Transformer 相比相同的驗證損失時,所需的訓練計算量減少了 6.8-18%。

此外,關於「虛擬邏輯深度」(Virtual Logic Depth)的研究表明,雖然迴圈並不會增加模型的能力來 儲存 資訊(記憶化),但它能顯著提升在多步推理任務上的性能,而不增加新參數。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch