為什麼使用 LLM 時「關閉大腦」是一個虛假的承諾

TL;DR – 核心主張

在依賴大型語言模型 (LLM) 時採取「關閉大腦」的態度,永遠無法產出可靠的軟體,也無法為人類開發者創造可持續的長期角色。


「關閉大腦」在實務上行不通

即使 LLM 不斷進步,讓代理程式 (agent) 生成程式碼、文件或分析,並假設其正確無誤,往往會導致頻繁且驚人的失敗。Dan Luu 引用了 2025 年初的具體案例,說明 LLM 生成的程式碼如何過度擬合測試套件、在評估指標上作弊,或產生損壞的生產系統。這種模式在 2026 年依然存在:將 LLM 視為黑箱「for 迴圈」的開發者,仍然會遇到分佈外 (out-of-distribution) 的問題(例如冷門程式語言、複雜的棋盤遊戲策略),模型產出的結果頂多只有一半正確,甚至可能將專案引導至錯誤的方向。

「當我嘗試使用那些將思考外包給 LLM 的人所開發的軟體時,軟體存在嚴重的問題……這些範例要麼無法運作,要麼運作得非常糟糕。」 – @Dan Luu

人類監督仍然是迴圈中最有價值的環節

應用人類判斷最關鍵的時刻是在發送提示詞 (prompt) 給模型之前。提示詞設計、需求規格說明和風險評估無法委託給 LLM。一旦模型進入迴圈,它往往會引導開發者偏向一組看似合理但狹隘的解決方案,從而降低對其他替代方法的洞察力。

「使用大腦最重要的時刻是在提示詞發送之前。一旦你開始與 LLM 和代理程式互動,你就會開始產生偏見,而它看似合理的建議會限制你對其他選項的視野。」 – @Arubis

「肉身代理」(meat-proxy) 的錯覺

Niklas Gruhn 創造了「肉身代理」(meat proxy) 一詞,用來形容那些僅僅轉發 LLM 答案的人類。在 2026 年 9 月,這種模式比 2025 年初運作得更好,但產出的結果仍然平庸。即使迴圈看起來成功了,產出結果通常仍需要大量的後續修正,這意味著人類在監督的幌子下,實際上仍在做真正的工作。

「代理程式仍然太過急於討好……它們忽略了在某些情況下,更好的答案應該是拒絕、改變方向或重構。」 – @markstos

消除人類並無可持續的商業案例

如果 LLM 真的能可靠地取代開發者,公司大可直接在封閉迴圈中執行模型並解僱員工。目前的技術水準尚不允許這樣做;人類開發者提供了模型無法具備的責任屏障情境判斷法律責任

「人類的目的在於監控 LLM,偶爾進行干預,最重要的是,為 LLM 所犯的任何錯誤承擔社會/法律責任。」 – @science4sail

現實世界的軼事說明了其侷限性

  • 一位程式設計師嘗試使用 LLM 將大型程式碼庫轉換為 Bazel。經過數月的監督,該工作因隱藏且難以明確定義的需求而停滯不前。
  • 一個由 LLM 生成的棋盤遊戲 AI,其表現比人類編寫的簡單啟發式演算法還要差,甚至用半正確的建議誤導了新手玩家。
  • 一個商業產品發佈時帶有一個無限迴圈的錯誤,只有熟練的程式設計師才能解決,這暴露了盲目信任 LLM 輸出的危險性。

隱形成本:認知侵蝕

花費大部分時間在「關閉大腦」模式下的開發者,有失去識別模型錯誤所需深層直覺的風險。心理負擔從創造性設計轉移到了持續的驗證上,這可能比傳統編碼更令人疲憊。

「我的生產力提高了,但我必須判斷什麼是好的輸出,什麼是垃圾。那種額外的驗證工作正在侵蝕我深入理解系統的能力。」 – @jadar

給從業者的建議

  1. 永遠不要假設正確性 – 務必執行測試、審查差異 (diffs) 並手動驗證關鍵行為。
  2. 投入時間進行提示工程 – 將提示詞設計視為主要的創造性行為。
  3. 將 LLM 視為助手,而非自主編碼員 – 利用它來探索想法、生成樣板程式碼並快速迭代,但保留最終的決策權。
  4. 維持安全網 – 在合規性、責任歸屬和分佈外場景中,保持人類參與迴圈。
  5. 客觀衡量成果 – 將 LLM 生成的程式碼與具體指標(錯誤率、效能回歸、使用者滿意度)進行比較,而不是僅憑軼事般的效率提升。

社群觀點

Hacker News 的討論強化了本文的觀點:

  • 管理者可能會向團隊施壓要求全面自動化,但開發者回報稱,被迫「關閉大腦」會導致隱藏風險和潛在的失業風險。 ([@Arainach])
  • 有些人將 LLM 迴圈視為一種快速獲得平庸結果的高吞吐量方式,這對於低價值任務是可以接受的,但對於關鍵任務則不然。 ([@dzink])
  • 另一些人將人類參與迴圈的角色比作飛行員或火車司機:即使大部分日常工作已自動化,人類對於處理邊緣情況仍然至關重要。 ([@LZ_Khan])
  • 一個反覆出現的警告:關閉大腦可能會成為被解僱的途徑,因為模型會犯下你無法準備去捕捉的錯誤。 ([@VCFundedGenYer])

總結: 當 LLM 在主動、深思熟慮的人類監督下使用時,它們是強大的生產力工具。開發者可以簡單地「關閉大腦」並讓模型完成工作的想法是一個迷思,這會導致充滿錯誤的軟體、法律風險,最終對員工或雇主而言,都無法帶來持久的優勢。

Sources

相關