LLM 引導技術的回歸:DeepSeek-V4-Flash 與對「智慧」旋鈕的追求

長期以來,影響大型語言模型 (LLM) 的主要方式一直是透過「前門」:提示詞 (prompting) 與微調 (fine-tuning)。然而,一種被稱為「引導」(steering) 的技術——在推論過程中直接操縱模型的內部激活值 (activations)——正重新受到關注。這一轉變很大程度上是由於強大的開源權重模型以及專門的推論引擎的出現,讓工程師能夠對模型進行即時的「腦部手術」。

最近的注意力集中在 DeepSeek-V4-Flash 以及像 DwarfStar 4 這樣的專案,後者是專為此模型設計的 llama.cpp 精簡版。由於引導需要存取模型的內部權重與激活值,這在歷史上一直是大型 AI 實驗室或學術研究人員的領域。隨著能夠與前沿級代理型編碼 (agentic coding) 競爭的本地模型出現,引導技術對更廣泛的開發者來說變得更具實用性。

引導的工作原理:操縱內部狀態

引導的核心在於從模型的內部腦部狀態中提取特定概念,並在生成過程中增強與該概念相關的數值激活值。

天真的方法:激活值差異法 (Activation Differencing)

一種簡單的方法涉及向模型輸入兩次提示詞:一次是正常輸入,另一次是帶有修飾詞(例如「簡短回答」)。透過從修改後的提示詞中減去正常提示詞的激活矩陣,研究人員可以分離出一個「引導向量」(steering vector)。接著,這個向量可以被添加到任何後續提示詞的激活值中,從而誘導出相同的行為,而無需在提示詞中明確要求。

進階的方法:稀疏自動編碼器 (Sparse Autoencoders)

更先進的技術(例如 Anthropic 使用的技術)涉及訓練第二個模型來提取「特徵」(features)——即一致出現的行為模式。這些特徵隨後會被映射回個別的概念。雖然計算成本更高,但這種方法比簡單的差異法能捕捉到更深層、更細微的模式。

引導的實際效用

雖然提示詞工程對於簡單任務通常已經足夠,但引導提供了幾種理論與實務上的優勢:

繞過模型拒絕

引導最強大的應用之一是「消融」(abliteration) 或去中心化。正如社群討論所提到的,許多模型的拒絕行為都與單一向量相關。透過識別並「削弱」(nerfing) 這個向量,就有可能動態地移除拒絕機制。

Antirez,DwarfStar 4 的創作者,指出這種執行時 (runtime) 方法優於直接修改 GGUF 檔案(模型權重)。在執行時應用引導可以實現精確的手術式應用——例如,僅在模型「思考」後應用,或僅在拒絕能量超過一定閾值時應用——從而將對模型一般能力的損害降至最低。

超越提示詞

有些人認為提示詞工程的侷限性在於它只能從現有的訓練數據中進行「模式挖掘」(pattern mining)。相反地,引導允許直接調整模型的內部狀態。這為 LLM 的「控制面板」開啟了大門,使用者可以調整代表簡潔度、盡責性或速度的滑桿,而無需進行提示詞工程的試錯過程。

懷疑者的觀點:引導僅僅是「作弊碼」嗎?

儘管令人興奮,但引導技術的大規模普及仍面臨重大障礙:

  1. 智慧悖論: 我們能找到代表「智慧」的引導向量嗎?像智慧這樣複雜的概念很可能與模型的整個權重集是共存的。嘗試引導智慧可能只是在描述訓練更聰明模型的過程。
  2. 數據壓縮限制: 對於複雜知識(例如「我特定代碼庫的知識」)進行引導的想法是非常雄心勃勃的。這類精細的概念可能需要完整的微調,而非簡單的激活值增強。
  3. 提示詞效率: 對於大多數使用者而言,在提示詞中加入「請簡潔回答」比計算並應用引導向量要快得多且更有效率。

結論:模型控制的未來

引導目前處於「中產階級」的位置:對於可以重新訓練模型的實驗室來說太過原始,對於一般的 API 使用者來說又太過技術化。然而,隨著開源權重模型變得越來越強大,以及像 DwarfStar 4 這樣的工具使內部激活值的存取變得民主化,情勢可能會改變。

如果社群可以為熱門模型建立一個可增強的特徵「庫」,我們可能會邁向一個未來,在那裡 LLM 不僅僅是透過提示詞來引導,而是像樂器一樣在執行時被調音,以符合開發者工作流的特定需求。

Sources