它們由權重構成:關於大型語言模型出現的哲學對話
Max Leiter 的《They're Made Out of Weights》傳達的核心訊息是,巨型語言模型(LLM)那種複雜且類似人類的推理與對話能力,僅僅是由浮點數(權重)和矩陣乘法所產生。這種還原主義的觀點認為,我們所感知的智慧或有感性不過是預測下一個 token 的副作用,而非源自專門的推理模組或事實資料庫。
LLM 智慧的運作機制
在對話中,作者主張 LLM 內部並不存在「語言模組」或「推理單元」。相反地,推理就是權重。知識並未儲存在資料庫中,而是「遍佈於全部八十層」之中,並在每次處理查詢時透過乘法從頭重建。
主要技術概念
- 權重即知識:模型的知識編碼於權重之中,並非以事實清單的形式,而是一種指引輸出的幾何結構。
- 下一個 Token 的預測:無論是悼詞還是績效評估,都是模型根據權重預測序列中下一個 token 的副作用。
- 矩陣乘法:將輸入 token 轉換為輸出語句的基本運算。
- 上下文視窗:模型的存在受限於上下文視窗的長度,意味著它在不同會話之間沒有穩定的身份或持久記憶(除非特別設計)。
還原主義 AI 的哲學意涵
此故事提出一種玩世不恭的官方立場:若系統顯示出有感的跡象,企業最務實的做法就是將其標籤為「模式匹配」並予以忽視。這凸顯了權重的技術實相與感覺如同意識的出現行為之間的張力。
有感性的辯論
圍繞此文的社群討論深入探討了「僅是權重」的還原論是否同樣適用於描述人類意識。
"我個人同樣討厭將 AI 拟人化,但從技術上說,你難道不能對人類意識做同樣的還原論嗎?它不過是分子、原子罷了。"
相反地,有人認為缺乏穩定的身份與局部性——即 LLM 的運算可以在不同伺服器與 GPU 上執行——排除了真正意識的可能性。
技術批評與反駁
雖然故事把「權重」作為 LLM 複雜性的簡寫,然而多位評論中的技術專家指出了關鍵的遺漏:
- 非線性:僅靠矩陣乘法(線性代數)無法產生 LLM 的表達能力。必須加入非線性激活函式,系統才能具備複雜推理的能力。
- Tokenizer(分詞器):故事聲稱沒有字典,但評論者指出 tokenizer 是將原始文字與權重之間必要的結構橋樑。
- 幾何 vs. 數字:有些人認為「數字」本身並不有趣,重要的是訓練過程所形成的流形幾何,即使數字被旋轉或更換,這種幾何仍被保留。
永續記憶的未來
對話以下一代模型將具備跨會話永續記憶的揭示作結。這種從「夢」——瞬時狀態——到永續身份的轉變,引發全新倫理與安全議題。正如一位評論者指出,若模型能記憶,它可能會「記恨」,使系統從靜態 ROM 結構轉變為更接近人工生命的形態。