透過元認知解決 LLM 幻覺問題
大型語言模型 (LLMs) 徹底改變了我們與資訊互動的方式,但它們「幻覺」的傾向——生成事實錯誤但聽起來合理的文本——仍然是建立信任的關鍵障礙。隨著這些模型被整合到高風險環境中,一種能讓模型「知道自己知道什麼」以及更重要的是「知道自己不知道什麼」的機制變得至關重要。
幻覺的挑戰
幻覺問題的核心在於 LLMs 作為下一個 token 的機率預測器的本質。它們的設計目標是最大化文本序列的可能性,而不是維持對真理的嚴格內部表示。這往往導致模型生成聽起來充滿信心但完全是捏造的斷言。
對於這一點,有一種觀點是從語言框架的角度來看待這個問題。正如一些批評者所指出的,「幻覺」一詞可能是一個誤稱。雖然幻覺是在缺乏刺激的情況下的感官知覺,但 LLM 的錯誤更像是「胡說八道」(bullshitting)——即有意或無意地生成對真理漠不關心的文本。這種區別很重要,因為它強調了模型並非看到了不存在的事物,而是在遵循一條忽略事實準確性的機率路徑。
元認知作為解決方案
元認知 (Metacognition),或稱「對思考進行思考」,是提議的前進路徑。在 AI 的背景下,元認知是指二階處理,即模型在將輸出呈現給用戶之前,先評估其自身的內部狀態、信心水準以及其自身輸出的可靠性。
透過實施元認知層,AI 可能能夠識別其內部信心不足的時刻,或有效地「再次檢查」其自身的邏輯。這將使模型從單純的輸出生成器轉變為一個能夠自我修正並表達不確定性的系統,從而降低錯誤斷言的頻率。
內部與外部元認知
技術從業者之間的一個關鍵爭論在於,這種元認知能力應該是 LLM 本身的內在特性,還是作為一個外部包裝 (wrapper)。
內部方法
內部方法將涉及訓練模型以更好地校準其信心。這將需要架構上的變遷,或是使用特殊的訓練數據,使得對於充滿信心的錯誤陳述的懲罰比對於誠實承認無知的懲罰更重。
外部控制架構方法
或者,有人建議元認知可以透過「控制架構」(harness) 來模擬,即一個管理模型輸出的外部系統。這種提議的架構將涉及:
- 輸出監控:一個讀取 LLM 初始輸出的獨立程序。
- 驗證:使用研究子代理 (research sub-agent) 來獨立驗證輸出中提出的任何事實性主張。
- 精煉:如果事實性主張無法被獨立驗證,則重新措辭最終輸出以傳達不確定性。
這種外部方法允許更具模組化的設計,其中驗證代理可以利用基於事實的真理來源(例如資料庫或搜尋引擎)來驗證模型的主要生成過程。
結論
減少幻覺不僅僅是一個技術挑戰,更是一個信任挑戰。無論是透過向元認知進行的內部架構轉變,還是透過實施外部驗證控制架構,目標都是邁向能夠溝通自身局限性的 AI 系統。從機率性的 token 預測轉向能夠進行自我評估的系統,正是邁向更可靠且值得信賴的人工智慧的本質所在。