十一月的轉折點:大型語言模型(LLM)演進的六個月
大型語言模型(LLM)領域的變遷速度之快,讓傳統的軟體開發週期顯得緩慢如冰川。在最近的一次回顧中,Simon Willison 強調了一個關鍵窗口——從 2025 年 11 月到 2026 年 5 月——他將其定義為「十一月的轉折點」。這段時期不僅僅代表了一系列模型的發布;它標誌著開發者與 AI 互動方式的根本轉變,從實驗性的輔助轉向可靠的日常生產力工具。
爭奪「最佳」模型的戰鬥
過去六個月中最引人注目的面向之一,就是排行榜的波動性。在 2025 年 11 月至 12 月期間,在 Anthropic、OpenAI 和 Google 這三大供應商之間,「最佳」模型的頭銜在五次之內易手。
從 Claude Sonnet 4.5 開始,冠軍頭銜轉向了 GPT-5.1,接著是 Gemini 3,然後是 GPT-5.1 Codex Max,最後落在了 Claude Opus 4.5 上。這種快速的震盪顯示了一種極度競爭的狀態,推理或編碼能力的微小增益正以週而非月為單位發布。
為了追蹤這些細微差別,Willison 使用了一種特定且非常規的基準測試:生成一個騎自行車的鵜鶘的 SVG。這項測試旨在避免訓練數據污染,因為騎自行車的鵜鶘在現有的數據集中並不是常見的主題。結果顯示出明顯的進步軌跡,最終以 Gemini 3.1 Pro 和 GLM-5.1 能夠產出高度勝任、甚至是動畫化的超現實任務版本。
編碼代理(Coding Agents)的崛起
雖然「感官導向」的排行榜非常華麗,但真正的技術突破發生在 2025 年 11 月:編碼代理變得真正實用。
這一飛躍主要由 Reinforcement Learning from Verifiable Rewards (RLVR) 所驅動。透過針對可驗證結果(例如代碼是否能實際編譯或通過測試套件)來訓練模型,OpenAI 和 Anthropic 將其模型推向了一個關鍵的品質障礙。編碼代理從「經常能用」轉變為「大多都能用」,讓開發者能夠將其作為主要工具使用,而不需要花費大部分時間來修復微小的錯誤。
「Claw」現象
這種新發現的代理能力催生了一種新型個人 AI 助手,俗稱為「Claws」,由 OpenClaw 專案所引發。這一趨勢變得如此普遍,以至於據報導,矽谷的 Mac Minis 銷量告罄,因為用戶正在購買硬體來運行這些本地代理。
然而,社群對於這些代理的長期可行性仍持分歧。一些用戶報告了一種工作中的「賽博格混合體(cybernetic blend)」,其中 AI 寫了 90% 的代碼,而其他人則認為代理在處理複雜、完整的應用程式時仍然感到吃力,且缺乏對其正在修改的軟體架構的深度理解。
本地模型革命
過去六個月的另一個主導主題是開源權重模型與本地模型的出人意料的表現。
- Gemma 4: Google 的最新系列被認為是來自美國公司的最強大開源權重模型之一。
- GLM-5.1: 一款來自中國的巨大 1.5TB 開源權重模型,只要用戶擁有支援的硬體,它就展現出極高的有效性。
- Qwen 3.6: 一款較小的模型(35B)可以在筆記型電腦上運行,但在特定的創意編碼任務中表現優於某些前沿模型。
這表明,專有前沿模型與本地模型之間的差距正在縮小,從而實現了更多以隱私為中心且具成本效益的部署方式。
批判性觀點與局限性
儘管令人興奮,技術評論家指出當前 LLM 架構存在一個根本性的天花板。社群中反覆出現的一種觀點是,LLM 正變得「巫師級的代碼助手」,但仍然缺乏內在的理解。
「AI 並不真正理解什麼是鴨子,它的組成部分,或者它完全是如何製作出這隻鴨子……它只是知道如何『吟唱』出這隻鴨子。當你試圖讓 AI 寫出正確的文檔時,這點變得非常明顯——即使在直接引導下,它也失敗得非常慘烈。
這「模式合成」與「內在理解」之間的區別是爭議的核心點。
雖然 RLVR 已使模型在產出可編譯的代碼方面表現卓越(因為編譯器提供了可驗證的獎勵),但這並不一定意味著 AI 理解業務邏輯或實作背後的「為什麼」。
六個月轉變的摘要
| 主題 | 先前狀態 | 轉折點後狀態 |
|---|---|---|
| 編碼代理 | 實驗性,需要大量監督 | 日常工具,對於生產環境大多可靠 |
| 模型主導地位 | 穩定的領導地位持續數月 | 「最佳」模型在週單位內快速更迭 |
| 本地模型 | 顯著弱於前沿模型 | 表現遠超預期 |
| 訓練焦點 | 通用文本預測 | RLVR (可驗證獎勵) |