Anthropic 递归自我改进的进展与趋势
AI 正在加速 AI 系统的开发
Anthropic 正日益将 AI 开发周期委托给 AI 系统,这导致了生产力的可衡量加速,并呈现出向递归自我改进(即 AI 系统自主设计并开发其后续版本)发展的轨迹。虽然完全的递归自我改进尚未成为现实,但内部数据表明,AI 已经在执行构建前沿模型所需的相当大一部分工程和研究任务。
工程领域的量化生产力提升
AI agent 已从简单的代码片段生成转向能够运行代码并委派工作的自主 agent。这种转变导致 Anthropic 的代码产出大幅激增:
- 代码编写: 截至 2026 年 5 月,合并到 Anthropic 代码库中的超过 80% 的代码是由 Claude 编写的。相比之下,在 2025 年 2 月 Claude Code 发布之前,这一数字仅为个位数。
- 工程师输出: 在 2026 年第二季度,典型的 Anthropic 工程师每天合并的代码量是 2024 年的 8 倍。
- 任务成功率: 在最具开放性的工程任务中,Claude 的成功率在 2026 年 5 月达到了 76%,在六个月内增长了 50 个百分点。
- 缺陷检测: 回溯性分析表明,自动化的 Claude review 可以捕捉到大约三分之一在进入生产环境之前曾导致 claude.ai 过去事故的 bug。
AI 研究能力的进步
除了编写代码,AI 系统在优化实验方面也展现出了超人性能,并且在提出研究方向方面展现出越来越强的能力。
实验优化: 在一项要求 Claude 使训练代码运行尽可能快的测试中,Claude Mythos Preview 在 2026 年 4 月实现了约 52 倍的加速,而 2025 年 5 月的 Claude Opus 4 仅实现了约 3 倍的加速。一名熟练的人类研究员通常需要四到八小时才能实现 4 倍的加速。
自主研究: 在 2026 年 4 月,由 Claude 驱动的 agent 开展了一项开放式的 AI 安全研究项目。在 800 个累计小时内,这些 agent 弥补了弱监督者与强模型之间的 97% 的性能差距,而两名人类研究员在一周内仅弥补了 23%。
研究判断力: 在衡量在调查性问题中选择“更好的下一步”能力的测试中,Mythos Preview 模型在 2026 年 4 月在 64% 的情况下击败了人类的选择,高于 2025 年 11 月 Opus 4.5 的 51%。
迈向递归自我改进之路
Anthropic 认为人类在开发过程中的角色正在缩小。目前的瓶颈正从“执行”(编写代码和执行实验)转向“决策”(研究品味与判断力)。
潜在未来场景
- 停滞/S 曲线: 由于规模效应的收益递减、Transformer 架构的限制或能源和算力供应链等物理约束,进展可能会进入平台期。
- 复合效率: AI 继续自动化研究的执行,但人类仍是研究方向的主要架构师。这可能导致 100 人的公司能够完成 100,000 人规模组织的规模工作。
- 完全递归自我改进: AI 系统开发出变革性的创造力并设计自己的后续版本。在这种情况下,进展的步伐仅受限于可用的算力。
批判性观点与反论点
虽然 Anthropic 展示了一条指数级增长的轨迹,但外部观察者和员工也针对这些主张的有效性和安全性提出了若干疑虑:
- 指标有效性: 批评者认为“代码行数”并不是生产力的良好代理指标,这表明 AI 可能只是在生成更冗长的代码,而不是更高效的解决方案。
- 运营稳定性: 一些用户报告称,尽管有超人级别的编程能力,Anthropic 的服务仍频繁出现停机和 API 限制,导致营销主张与用户体验之间存在脱节。
"I fail to see how pursuing recursive self-improvement at full speed is compatible with Anthropic's stated goal of AI Safety. If nukes were not invented yet, would it really be a good idea to build and sell them as fast as possible?"
- 硬件瓶颈: 一些人认为真正的约束是硬件效率(例如,compute-in-memory),且软件层面的递归改进无法克服这些物理限制。
协调与“暂停选项”
Anthropic 建议,如果存在一个可验证的全球协调机制,那么减缓或暂停前沿 AI 开发以允许社会结构和对齐研究跟上进度是有益的。然而,他们指出,这种暂停很难实现,因为训练任务很容易被隐瞒,从而为参与者违约并保持竞争优势创造了极高的激励。