停止將中間 Token 擬人化為推理軌跡
中間 Token 並非「思考」過程
中間 Token 生成 (Intermediate Token Generation, ITG) 是一種標準方法,透過在得出最終解答之前產生輸出,來提升語言模型在複雜推理任務上的表現。然而,一篇發表於 ICML 2026 的立場論文《Position: Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces!》指出,將這些輸出稱為「推理軌跡」或「思考軌跡」是一種危險的擬人化行為。作者主張,這些術語暗示模型正在遵循類人的認知步驟,這會誤導社群對這些模型本質的理解,並導致存疑的研究方向。
「思考」隱喻的危險性
核心論點在於,將中間 Token 視為觀察模型「思考過程」的可解釋窗口,是對 LLM 架構的根本誤解。由於這些模型是基於機率生成 Token,因此產生的文本實際上是一連串的預測,而非對解決方案的有意識推導。
文中引用了一個具體的例子,即「aha」時刻——模型可能會輸出一個表示突然領悟的 Token。作者認為這並非內部狀態改變的跡象,因為模型的正向傳遞 (forward pass) 與前一次相比,僅僅是上下文 (context) 中包含了該 Token。將此類時刻解釋為有意義的認知轉變,是一種毫無根據的假設。
工程與研究影響
將這些 Token 擬人化會對 AI 系統的審計與開發方式產生實際影響。如果中間 Token 並非底層運算的忠實呈現,它們就無法作為可靠的審計人工製品 (audit artifacts)。
從解釋性轉向可重現性
技術討論建議,工程師不應試圖讓模型的內部敘述變得更具可解釋性,而應專注於提高運算的的可重現性。這包括記錄實際的輸入、模型版本、配置以及工具觀察結果,以隔離不同執行次數之間的差異,而非要求模型解釋其「想法」。
軌跡與結果之間的脫節
社群的觀察指出了一種常見的失效模式:模型經常輸出「推理軌跡」,在其中識別出錯誤(例如「等等,那是不對的」),卻在最終答案中犯下完全相同的錯誤。這種脫節證明了 Token 的名義意義並不總是決定最終的輸出。
社群觀點與反論點
研究人員與從業者之間的討論揭示了對於應如何看待這些 Token 的分歧:
- 隱喻觀點: 有人認為「推理 Token」僅僅是「已學習的提示詞增強 Token」的一個方便簡稱,且大多數嚴肅的研究人員將其視為一種隱喻,而非對認知的字面描述。
- 功能觀點: 也有人建議,雖然 Token 並非在「思考」,但它們充當了一種「數位草稿本」的角色。生成中間文本有助於模型透過提供結構化的上下文來更有效地計算最終答案。
- 強化學習 (RL) 的影響: 有人指出,強化學習 (RL) 會獎勵準確的最終答案,這會迫使模型發展出錯誤修正的習慣。雖然這讓輸出 看起來 像人類的思考(例如驗證與修正步驟),但它仍然是一個機率生成的機械過程。
- 人類類比: 一種反論點認為,人類的內心獨白也不一定總是潛意識數據處理的忠實呈現,這暗示了「軌跡」與「結果」之間的差距是人工智慧與人類智慧共同的特徵。
"If intermediate tokens are not a faithful representation of the computation, then they are a pretty bad audit artifact too. We probably shouldn't be trying to make the model's internal narration more interpretable, but rather the computation around it more reproducible."
結論
ICML 2026 的論文作者呼籲 AI 社群應停止在描述中間 Token 時使用「思考」與「推理」等語言。透過將這些軌跡視為黑盒或機械性的增強手段,而非認知窗口,研究人員可以避免過度心理化 (hypermentalizing) 的陷阱,並開發出更穩健、更具根據的方法來評估與審計 AI 的表現。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch