GPT-6 Astra: 루프형 트랜스포머와 숨겨진 추론에 대한 논쟁
GPT-6 Astra는 3D 렌더링, 애니메이션 및 일반적인 컴퓨터 사용 능력에서 중요한 도약을 나타냅니다. OpenAI는 공식적으로 아키텍처를 확인하지 않았지만, 증거와 산업 보고서는 모델이 "루프형 트랜스포머"(또는 반복적 깊이)를 사용하여 추론 성능을 향상시키면서도 관리 가능한 파라미터 크기를 유지한다고 시사합니다.
고도화된 컴퓨터 사용 및 훈련 인프라
GPT-6 Astra는 그래픽 사용자 인터페이스(GUI)와 상호작용하는 데 뛰어난 능력을 보이며, Codex/ChatGPT 앱을 통해 로컬 컴퓨터의 소프트웨어를 운영할 수 있습니다. 이 능력은 블렌더에서 뉴욕 시티를 렌더링하거나 마우스 커서 시뮬레이션을 통해 MS 페인트로 이미지를 다시 그리는 등의 복잡한 작업을 수행할 수 있음으로써 입증됩니다.
이 "컴퓨터 사용" 능력은 강화 학습과 검증 가능한 보상(RLVR)을 포함하는 특정 훈련 워크플로우에 의해 가능해집니다:
- 작업 프롬프트: 모델에 목표(예: "앱 X를 열고 Y를 수행")가 주어집니다.
- 시각적 피드백: 하드웨어 환경이 운영체제 인터페이스의 스크린샷을 제공합니다.
- 행동 예측: LLM이 마우스 및 키보드 동작을 예측합니다.
- 실행: 하드웨어 환경이 OS에서 이러한 동작을 실행합니다.
- 반복 루프: 새로운 스크린샷을 기반으로 프로세스가 반복되어 작업이 성공하거나 실패할 때까지 진행됩니다.
이를 지원하기 위해 OpenAI는 약 10만 개의 NVIDIA Grace Blackwell GPU에서 모델 훈련을 수행하면서, macOS 상호작용을 학습할 수 있는 환경으로 수만 대의 맥 미니와 맥 스튜디오를 구입한 것으로 보고되었습니다.
루프형 트랜스포머 이해하기
루프형 트랜스포머는 중간 표현을 동일한 트랜스포머 블록을 여러 번 통과시키는 아키텍처적 수정입니다. 전통적인 트랜스포머가 깊이를 늘리기 위해 더 많은 독립적인 레이어를 추가하는 반면, 루프형 트랜스포머는 기존 블록의 가중치를 재사용합니다.
주요 아키텍처 변형
- 고정 루프(예: Nanbeige4.2-3B): 모델은 트랜스포머 블록 스택을 고정된 횟수만큼(예: 두 번) 적용합니다. 이는 파라미터 저장 공간을 늘리지 않으면서도 효과적인 깊이를 증가시킵니다(예: 22에서 44개 블록 적용).
- 적응형 정지(예: Universal Transformers): 모델은 각 토큰에 대해 "정지 확률"을 예측하는 학습된 함수를 사용합니다. 누적 확률이 임계값을 초과하면 루프가 중단되며, 어려운 토큰에 더 많은 계산 자원을 할당할 수 있습니다.
- 재귀의 혼합(MoR): 라우터가 토큰이 공유 스택을 통과하는 횟수를 결정합니다. 이는 전문가 선택 라우팅(단계가 토큰을 선택) 또는 토큰 선택 라우팅(라우터가 시작 시 경로를 할당)으로 수행될 수 있습니다.
- 잠재적 추론: 일부 변형은 초기 및 최종 블록 사이에 공유 스택을 끼워 넣고, 각 루프 시작 시 초기 표현을 스택에 다시 공급하여 일관된 기준점을 제공합니다.
계산적 트레이드오프
루프형 트랜스포머는 distinct한 가중치 수를 줄여 GPU 메모리 사용을 절약하지만, 순방향 전파의 계산 비용을 줄이지 않습니다. 블록을 두 번 실행하는 것은 두 개의 독립적인 블록을 실행하는 것과 동일한 계산량을 필요로 합니다. 또한 KV 캐시 요구량을 줄이지 않습니다. 중간 상태가 각 루프마다 다르기 때문에, 각 루프마다 별도의 KV 캐시 항목이 필요합니다.
"숨겨진 추론" 논란
The Information의 보고서는 Astra의 반복적 깊이 사용이 추론 흔적(Chain of Thought)을 "숨기게" 한다고 주장하며, 보안과 해석 가능성에 대한 우려를 제기했습니다. 그러나 기술적 분석은 루프가 추론을 은폐하는 주요 메커니즘이 아니라고 시사합니다.
추론 흔적 vs. 잠재적 계산
추론 모델은 일반적으로 생각을 하기 위해 외부 토큰의 "스크래치패드"를 사용합니다. 루프형 트랜스포머는 토큰당 내부 계산을 늘립니다. 더 강력한 모델(예: Astra)은 더 효율적이거나 실수를 덜 하기 때문에 외부 추론 흔적이 짧아질 수 있지만, 이는 증가한 지능의 결과일 뿐, 논리 구조를 의도적으로 숨기기 위한 아키텍처적 시도는 아닙니다.
산업 관점
OpenAI 최고 과학자 자쿠브 파코cki는 Astra의 계산 그래프 깊이가 GPT-4와 두 배 이내임을 강조하며, OpenAI가 여전히 정렬을 위한 체인 오브 쓰로우 모니터링을 우선시하고 있다고 밝혔습니다. 또한 모니터링 가능성은 "부정적인 방향으로 추세를 보이고 있지만", 이는 아키텍처 변경에 의존하지 않는다고 언급했습니다.
커뮤니티 반론
일부 연구자와 사용자는 잠재적 추론으로의 전환(텍스트 출력 없이 은닉 상태에서 더 많은 처리를 수행)이 본질적으로 모니터링 가능성을 감소시킨다고 주장합니다.
"은닉 공간 내에서 텍스트를 출력하지 않고 더 많은 처리가 이루어질수록, 효과적이고 자주 발생하는 체인 오브 쓰로우 모니터링이 줄어들고, 더 많은 모니터링되지 않은 은닉 공간의 오작동 가능성도 커집니다."
성능 및 스케일링 법칙
최근 연구, 예를 들어 2026년 9월의 SMELT 논문은 루프형 트랜스포머가 계산적으로 효율적이라고 제안합니다. 추가 블록 적용을 보상하기 위해 은닉 차원을 좁히고, MoE를 추가하여 파라미터 수를 회복함으로써 SMELT 모델은 전통적인 트랜스포머와 동일한 검증 손실에 도달하기 위해 훈련 계산량을 6.8~18% 줄일 수 있었습니다.
또한 "가상 논리 깊이"에 대한 연구는 루프가 모델의 정보 저장 능력(기억)을 증가시키지 않지만, 새로운 파라미터를 추가하지 않고도 다단계 추론 작업에서 성능을 크게 향상시킨다고 밝히고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch