十一月的拐点:回顾大语言模型(LLM)演进的六个月

大语言模型(LLM)领域的发展速度之快,让传统的软件开发周期显得极其缓慢。在最近的一次回顾中,Simon Willison 概述了过去六个月的关键进展,并指出 2025 年 11 月是一个特定的“拐点”,它从根本上改变了 AI 的效用,特别是对于软件工程而言。

这一时期不仅以对“最佳”模型的竞逐为特征,还以这些模型与代码交互方式以及本地部署方式的定性转变而为特征。

争夺王座:模型的波动性

在 2025 年 11 月至 2026 年 5 月期间,在 Anthropic、OpenAI 和 Google 这三大供应商之间,“最佳”模型的头衔在五次易手。这一序列见证了 Claude Sonnet 4.5 被 GPT-5.1 超越,随后是 Gemini 3,GPT-5.1 Codex Max,以及最后的 Claude Opus 4.5。

为了追踪这些变化,Willison 使用了一个特定且非常规的基准测试:生成一个骑自行车的鹈鹕的 SVG。其逻辑在于,鹈鹕和自行车本身都很难渲染,而两者的结合如此荒诞,以至于不太可能成为训练数据的特定目标。虽然 Gemini 3.1 Pro 最终生成了一个细节非常丰富的版本——甚至在篮子里放了一条鱼——但排行榜的波动性表明,“感觉(vibes)”和特定任务的表现往往比单一的决定性胜者更重要。

十一月的拐点:当编程代理(Coding Agents)变得“好用”

虽然模型排名在波动,但更重大的进展是编程代理的成熟。在整个 2025 年,OpenAI 和 Anthropic 大力投入了基于可验证奖励的强化学习(RLVR)。到 11 月,这一努力跨越了一个关键阈值。

编程代理从“经常能用”转变为“基本好用”。这一转变使得开发者能够将代理作为日常工作的核心工具,而不是将大部分时间花在纠正琐碎的幻觉上。这一突破为 OpenClaw 等项目铺平了道路,这是一款在 2026 年初获得巨大关注度的个人 AI 助手,并导致了 Mac Mini 的销量激增,因为用户纷纷寻求硬件来本地运行他们的“Claws”。

开发的“赛博网络融合”

社区反馈突显了关于这一转变的极化体验。一些开发者报告称,他们的工作流程发生了彻底的变革,描述了一种“同质化的赛博网络融合”,即 AI 编写了 90% 的代码,但人类保持着所有权和架构监督权。

我拥有这一切,可以立即解释所有内容,但我亲手写的可能只有 10%。就 AI 转型方面而言,开发团队现在应该已经基本“解决”了。

相反,其他人则认为“拐点”在一定程度上是营销噱头,指出虽然代理在工具调用(tool-calling)和导航大型代码库方面表现更好,但如果没有人类的深度引导,它们仍然难以从零开始构建完整的应用程序。 \n## 本地与开源权重模型的崛起

过去六个月的另一个主导主题是本地模型的惊人表现。虽然前沿模型在原始推理能力方面仍占据优势,但笔记本电脑可用的模型表现远超预期。

  • Gemma 4: 由 Google 发布,被认为是来自美国公司的最强大的开源权重模型之一。
  • GLM-5.1: 来自中国的庞大 1.5TB 开源权重模型,只要用户拥有支持它的硬件,它就能在复杂任务中展现出极高的能力。
  • Qwen 3.6: 一个较小的模型(35B),可以在标准笔记本电脑上运行,但在特定的创意编程任务中表现优于一些更大的前沿模型。

关键的反面观点:综合 vs. 理解

尽管取得了进展,技术批评者指出一个根本性的局限:*模式综合(pattern synthesis)内在理解(intrinsic understanding)*之间的差距。通过 RLVR 和 g++ 或 tsc 等编译器的“可验证奖励”驱动生成能够编译的代码的能力,并不一定意味着 AI 理解其底层的逻辑。

一位观察者指出,AI 本质上是在根据模式进行“吟诵(incanting)”。当 AI 在需要更高抽象层级的任务中失败时,这一点变得显然,例如编写全面的文档或根据精确的概念向量调整图像。

时代总结

过去六个月证明了“套件(harness)”——围绕模型本身的工具、指令和可验证反馈循环的生态系统——与模型本身同样重要。随着我们迈向 2026 年,重点正在从“AI 是否能写代码”转向“这些代理如何能被集成到业务流程中,以实现复杂、领域特定的过程自动化”。

Sources