중간 토큰을 사고 과정으로 인과화하는 것을 멈추라

중간 토큰은 '사고' 과정이 아니다

중간 토큰 생성(Intermediate Token Generation, ITG)은 복잡한 추론 작업에서 언어 모델의 성능을 향상시키기 위해 최종 해답을 내기 전에 출력을 생성하는 표준적인 방법이다. 그러나 ICML 2026에서 발표된 논문 "Position: Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces!" 는 이러한 출력을 '추론 흔적'이나 '사고 흔적'이라고 부르는 것은 위험한 인과화라고 주장한다. 저자들은 이러한 용어들이 모델이 인간과 유사한 인지적 단계를 따르고 있다고 암시하며, 이는 모델의 본질에 대한 오해를 초래하고 신뢰할 수 없는 연구로 이어진다고 주장한다.

'사고' 비유의 위험성

핵심 주장은 중간 토큰을 모델의 "사고 과정"에 대한 해석 가능한 창으로 보는 것은 LLM 아키텍처에 대한 근본적인 오해라는 것이다. 이러한 모델들은 확률에 기반해 토큰을 생성하기 때문에, 결과적으로 생성된 텍스트는 인식된 해결책의 의식적 도출이 아니라 예측의 시퀀스에 불과하다.

구체적인 예로 언급된 것은 '아하!' 순간—모델이 갑작스러운 인식을 나타내는 토큰을 출력하는 경우이다. 저자들은 이것이 내부 상태의 변화를 의미하는 것이 아니라고 주장한다. 모델의 순방향 전파는 이전 단계와 비교해 해당 토큰이 컨텍스트에 포함된 것 외에는 차이가 없기 때문이다. 이러한 순간을 의미 있는 인지적 전환으로 해석하는 것은 정당하지 않은 가정이다.

공학적 및 연구적 함의

이러한 토큰을 인과화하는 것은 AI 시스템의 감사 및 개발 방식에 실질적인 영향을 미친다. 만약 중간 토큰이 기반이 되는 계산의 충실한 표현이 아니라면, 그들은 신뢰할 수 있는 감사 자료로 사용될 수 없다.

해석에서 재현 가능성으로 전환하기

기술적 논의에서는 모델의 내부 설명을 더 해석 가능하게 만들려는 시도보다, 계산 자체를 더 재현 가능하게 만들도록 하는 것이 더 중요하다고 제안한다. 이는 모델의 실제 입력, 버전, 구성, 도구 관찰 기록을 통해 실행 간 차이를 분리하는 방식이어야 하며, 모델이 자신의 "사고"를 설명하도록 요구하는 것이 아니라, 그 주변의 계산을 더 재현 가능하게 만드는 데 초점을 맞춰야 한다.

흔적과 결과 사이의 단절

커뮤니티의 관찰에 따르면 흔한 실패 모드는 모델이 오류를 인식하는 "추론 흔적"을 출력하지만(예: "잠깐, 이게 틀렸어"), 최종 답변에서는 정확히 같은 오류를 반복하는 경우이다. 이 단절은 토큰의 명목상 의미가 항상 최종 출력을 지배하지 않는다는 것을 보여준다.

커뮤니티의 시각과 반론

연구자들과 실무자들 사이의 논의는 이러한 토큰을 어떻게 보아야 할지에 대해 분열된 시각을 보여준다:

  • 비유적 시각: 일부는 "추론 토큰"이라는 표현이 단지 "학습된 프롬프트 보강 토큰"을 위한 편리한 약어일 뿐이며, 대부분의 진지한 연구자들이 이를 인지적 과정의 실질적 설명이 아니라 비유로 취급한다고 주장한다.
  • 기능적 시각: 다른 이들은 토큰이 "사고"하는 것은 아니지만, 디지털 스케치패드와 같은 역할을 한다고 제안한다. 중간 텍스트를 생성함으로써 모델은 더 구조화된 컨텍스트를 활용해 최종 답변을 더 효과적으로 계산할 수 있다.
  • 강화학습의 영향: 일부는 강화학습(RL)이 정확한 최종 답변을 보상하기 때문에, 모델이 오류 수정 습관을 개발하도록 강요한다는 점을 지적한다. 이는 출력이 인간의 사고처럼 보이게 만든다(예: 검증 및 수정 단계), 그러나 여전히 확률 생성의 기계적 과정이다.
  • 인간과의 유사성: 반론으로는 인간의 내면 독백도 항상 무의식적 데이터 처리의 충실한 표현은 아니며, "흔적"과 "결과" 사이의 간극은 인공지능뿐 아니라 인간 지능의 특징일 수 있다고 제기한다.

"만약 중간 토큰이 계산의 충실한 표현이 아니라면, 그들은 아주 나쁜 감사 자료이기도 하다. 아마도 우리는 모델의 내부 설명을 더 해석 가능하게 만들려는 시도를 멈추고, 그 주변의 계산을 더 재현 가능하게 만드는 데 집중해야 할 것이다."

결론

ICML 2026 논문의 저자들은 중간 토큰을 설명할 때 "사고"나 "추론"이라는 언어를 포기할 것을 AI 커뮤니티에 촉구한다. 이러한 흔적을 인지적 창이 아니라 블랙박스 또는 기계적 보강으로 보는 태도를 취함으로써, 연구자들은 과잉정신화의 함정을 피하고, AI 성능을 평가하고 감사하는 더 견고하고 현실적인 방법을 개발할 수 있다.

Sources

관련