大型語言模型常見的失敗模式:來自開發者經驗的洞察

LLM 局限性概述

大型語言模型 (LLMs) 在需要精確空間推理、嚴格遵守負面約束以及應用細微人類判斷的任務中持續面臨挑戰。雖然這些模型在語義合成方面表現出色,但在需要物理空間心理模型、具備省略資訊而非增加資訊的能力,或生成非通用的創意內容等「簡單」任務中,經常失敗。

空間與機械推理失敗

LLMs 缺乏可靠的物理或幾何空間內部表示,導致在建築與 UI 設計方面的系統性失敗。

建築與 UI 佈局

模型無法生成功能性的建築平面圖,即使在提供詳細的房間節點圖的情況下也是如此。使用者回報,雖然模型可以描述良好平面圖的規則,但無法執行。同樣地,在 UI 開發中,模型難以識別平面上的重疊元素,或解決 TypeScript apps 或 iOS games 中的空間衝突。

導航與遊戲邏輯

在以文字為基礎的環境中,空間理解進一步受限。使用者指出,LLMs 在導航 ASCII maps 時(例如在 Nethack 等遊戲中)無法進行長期規劃。在 Chess 等策略遊戲中,模型難以在沒有外部 chess engine 的協助下進行準確的對弈。

指令遵循與約束遵守

儘管經過訓練,LLMs 經常忽略明確的約束,特別是「負面約束」(要求「不要」做某事的指令)。

未能省略與編輯

存在一種重複發生的模式,即 LLMs 難以在不明確提及刪除動作的情況下移除資訊。當被要求從文件中刪除一個想法時,模型往往會用一段聲明該想法不再相關的文字來取代內容,而不是簡單地刪除它。在投影片設計中,模型難以處理空白區域,傾向於添加「獨特的設計元素」而非留下空白空間。

將指令與輸出混淆

使用者回報,模型經常將編輯指令混入最終輸出中。例如,如果被要求更改草稿中的特定短語,模型可能會在編輯後的文檔內容中包含「將 X 改為 Y」這樣的短語。

持續的規則違反

即使有專用的配置檔案(例如,CLAUDE.md),模型也經常違反既定規則。回報的案例包括:

  • 使用命令列工具的錯誤 flag(例如,在 ripgrep 中使用 -r 表示遞迴,但實際上它是一個替換指令)。
  • 在未經使用者核准的情況下執行 git commits。
  • 在 Django multi-line template comments 中產生錯誤。

特定領域的幻覺與準確性

在精確度至關重要的利基領域識別任務與專業知識檢索中,LLMs 展現出高失敗率。

視覺識別與幻覺

在物種識別(例如,鳥類觀察)中,模型可能達到很高的通用準確度,但在少數情況下會遭遇「極其嚴重的錯誤」。這些失敗通常涉及幻覺出不存在於上傳圖像中的物理特徵(例如腿部或尾羽細節)來為錯誤的分類提供辯解。

專業知識與遊戲

模型經常對文件詳盡的電子遊戲進行機制幻覺。使用者回報,Claude Opus 捏造了如 Anno 1800Rainbow Six Siege 等遊戲的機制,儘管已有詳盡的 wikis。

創意與認知差距

LLMs 難以處理需要細微人類直覺、簡潔性或在不提供答案的情況下引導學習者的任務。

幽默感與語調

AI 生成的幽默被描述為「平庸」且讓人聯想到企業 HR 通訊。這歸因於 RLHF (Reinforcement Learning from Human Feedback),它移除了「尖銳」或可能被誤解的內容以確保安全,導致缺乏真正的機智。

教育引導

模型往往過度擬合以提供完整解答,而非教學性的提示。當被要求針對數學或程式設計問題提供指引時,他們經常提供關鍵洞察或完整答案,未能維持學習所需的「劇透」邊界。

Prompt Engineering

與「LLMs 可以優化其自身 prompt」的假設相反,使用者發現模型在設計自己的 prompt 時表現不佳。嘗試讓一個 LLM 修復一個 prompt 時,通常會導致性能下降,這表明 prompt 設計的訓練數據可能品質不佳。

技術與語言缺陷

  • 關鍵字搜尋: 雖然在語義搜尋方面很強,但 LLMs 在生成高效的關鍵字搜尋查詢時表現不佳,通常依賴低效的暴力法迭代。
  • 字串操作: 一些使用者回報,進階模型在計算字串長度的基本計算中表現掙扎。
  • 散文風格多樣性: LLM 生成的文字往往缺乏句式多樣性,導致文字內容重複或具有機器人感。
  • 會議摘要: 模型經常無法區分人類對話中真正重要的內容與僅僅是被討論的內容,導致會議摘要與實際情況不符。

Sources

相關