GPT-6 Astra: ループ型トランスフォーマーと隠れた推論に関する議論
GPT-6 Astraは、特に3Dレンダリング、アニメーション、および一般的なコンピュータ利用において、顕著な進歩を遂げています。OpenAIは正式にそのアーキテクチャを確認していませんが、証拠や業界報道から、モデルは「ループ型トランスフォーマー」(または再帰的深度)を用いて推論性能を向上させつつ、パラメータ数を管理可能な範囲に保っている可能性があります。
高度なコンピュータ利用とトレーニングインフラ
GPT-6 Astraは、グラフィカルユーザーインターフェース(GUI)との相互作用に非常に優れており、Codex/ChatGPTアプリを通じてローカルコンピュータ上のソフトウェアを操作できます。この能力は、Blenderでニューヨーク市をレンダリングする、またはマウスカーソルのシミュレーションを使ってMS Paintで画像を再描画するといった複雑なタスクを実行できることで裏付けられています。
この「コンピュータ利用」能力は、検証可能な報酬を用いた強化学習(RLVR)を含む特定のトレーニングワークフローによって実現されています:
- タスクプロンプト: モデルに目標(例:「アプリXを開いてYを行う」)が与えられる。
- 視覚フィードバック: ハーネスがOSインターフェースのスクリーンショットを提供する。
- 行動予測: LLMがマウスおよびキーボードの行動を予測する。
- 実行: ハーネスがOS上でこれらの行動を実行する。
- 反復ループ: タスクが成功または失敗するまで、新しいスクリーンショットとともにプロセスが繰り返される。
これを支えるために、OpenAIはmacOSの操作を学ぶための環境として、数万台のMac MiniおよびMac Studioを購入したと報じられています。一方、実際のモデルトレーニングは約10万のNVIDIA Grace Blackwell GPU上で行われました。
ループ型トランスフォーマーの理解
ループ型トランスフォーマーは、中間表現を同じトランスフォーマーブロックに複数回通すことで、アーキテクチャを変更する手法です。従来のトランスフォーマーが深度を増すためにより多くの異なるレイヤーを追加するのに対し、ループ型トランスフォーマーは既存のブロックの重みを再利用します。
主なアーキテクチャのバリエーション
- 固定ループ(例:Nanbeige4.2-3B): モデルはトランスフォーマーブロックのスタックを固定回数(例:2回)適用する。これにより、パラメータ数を増やさずに有効な深度(例:22から44ブロック適用)を増加できる。
- 適応停止(例:Universal Transformers): モデルは各トークンに対して「停止確率」を学習した関数を出力する。累積確率が閾値を超えるとループが停止し、難易度の高いトークンに多くの計算リソースを割り当てられる。
- 再帰の混合(MoR): ルーターが共有スタックを通過するトークンの回数を決定する。これはエキスパート選択ルーティング(ステップがトークンを選択)またはトークン選択ルーティング(ルーターが開始時にパスを割り当てる)で実現できる。
- 潜在的推論: 一部のバリエーションでは、初期および最終ブロックの間に共有スタックを挟み、各ループの開始時に初期表現をスタックに戻すことで、一定の参照点を提供する。
計算上のトレードオフ
ループ型トランスフォーマーは、異なる重みの数を減らすことでGPUメモリを節約しますが、フォワードパスの計算コストを削減するものではありません。ブロックを2回実行するには、2つの異なるブロックを実行するのと同じだけの計算量が必要です。さらに、KVキャッシュの要件も削減されません。中間状態は各パスで異なるため、各パスごとに独自のKVキャッシュエントリが必要です。
「隠れた推論」に関する論争
The Informationの報道によると、Astraが再帰的深度を使用することで「推論の痕跡(Chain of Thought)を隠す」ことができ、セキュリティおよび解釈可能性に関する懸念が生じたとされています。しかし、技術的な分析では、ループが推論を隠す主なメカニズムではないと示唆されています。
推論の痕跡 vs. 潜在的計算
推論モデルは通常、外部トークンの「スクラッチパッド」を使って思考します。ループ型トランスフォーマーはトークンあたりの内部計算を増加させます。より能力の高いモデル(例:Astra)は、効率が高かったり、誤りが少なかったりするため、外部の推論痕跡が短くなる可能性がありますが、これはより高い知能の結果であり、論理を意図的に隠すためのアーキテクチャ的な試みとは限りません。
業界の見解
OpenAIのチーフサイエンティストであるJakub Pachocki氏は、Astraの計算グラフの深さはGPT-4と2倍以内であると明言し、OpenAIがアライメントのためのChain-of-Thoughtモニタリングを引き続き重視していると強調しました。また、モニタビリティは「負の方向に傾いている」と指摘しつつも、これはアーキテクチャの変更に依存するものではないと述べました。
コミュニティの反論
一部の研究者やユーザーは、潜在的推論(テキスト出力なしに隠れ状態でより多くの処理を行う)へのシフトが inherently モニタビリティを低下させると主張しています。
"隠れ空間内でテキストを出力せずにより多くの処理が行われる場合、効果的かつ頻繁なChain-of-Thoughtモニタリングが難しくなり、潜在的空間での不正行為の可能性が高まる。"
パフォーマンスとスケーリング則
最近の研究、たとえばSMELT論文(2026年9月)によると、ループ型トランスフォーマーは計算的に効率的です。隠れ次元を狭めることで追加のブロック適用を補償し、MoEを追加してパラメータ数を回復することで、SMELTモデルは従来のトランスフォーマーと同等の検証損失に到達するためのトレーニング計算量を6.8〜18%削減できました。
また、「仮想論理深度」に関する研究では、ループはモデルの情報の記憶能力を増加させないものの、新しいパラメータを追加せずに、複数ステップの推論タスクにおけるパフォーマンスを著しく向上させることを示しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch