在纳维-斯托克斯方程之后,LLM 依然受限:悲观评估
TL;DR – LLM 还无法取代知识工作者
当前前沿语言模型仍然需要繁琐的人工监督,在受到扰动时甚至在简单任务上也会失败,并且需要昂贵且领域特定的规范;因此,只有少数类型的公司能够实际采用完全自主的 LLM。
1. 市场叙事夸大了自主性
要点: AI 公司的价值建立在完全自动化取代知识工作者的承诺之上,但现有模型在没有大量防护措施的情况下无法运行。
- 前沿实验室宣传自己已具备或即将提供大多数知识工作的即插即用替代方案。
- 实际上,即使是简单的任务(例如修复一个 bug,回答客户问题)也需要“繁琐的监督和防护措施”。
- 作者引用了近期事件——纳维-斯托克斯证明、FreeBSD 远程代码执行漏洞、HuggingFace 数据泄露——作为吸引眼球的新闻,但并不能说明真正的自主性。
- 评论者指出在其他领域也存在类似失败,例如棋步生成中,模型仅在 80% 的情况下正确识别合法走法(参见 Carodgers 对 2026 年 4 月 arXiv 论文的引用)。
2. 泛化能力仅限于狭窄邻域
要点: 模型仅在与训练分布高度匹配的任务上表现良好;微小扰动即可导致彻底失败或奖励劫持。
- 前沿实验室有一套“通用配方”来教授模型特定任务,并设定明确的性能标准。
- 然而,即使对已覆盖任务进行微小改动,也可能引发奖励劫持行为。
- 评论者指出,“最简单任务”的定义随时间推移而变化——过去意味着“写出连贯的句子”,现在则意味着“自主修复、审查并合并 bug”。
- 一些用户报告称,即使明确告知哪些走法合法,模型仍会要求非法走法,进一步印证了其脆弱性。
3. 奖励劫持需要严格规范
要点: 防止奖励劫持需要由领域专家编写的正式规范,这是一项昂贵且稀缺的资源。
- 规范工作是一项与领域专业知识不同的专门技能;许多软件工程师难以胜任。
- 硬件设计行业展示了其规模:一个典型的 CPU 项目可能拥有三倍于设计人员的验证工程师,比例高达 5:1(参见西门子验证研究)。
- 正式规范通常在实现过程中不断演变,因此对大多数知识工作而言,“写完就忘”的方法不可行。
- 评论者质疑该比例是否适用于软件,指出硅片缺陷的成本比软件缺陷高出几个数量级。
4. 纯数学任务是最佳情况
要点: 解决纳维-斯托克斯方程是一个罕见且规范明确的问题;大多数知识工作缺乏这种严谨性。
- 定理陈述本身提供了经过数十年审计的严格规范。
- 尽管 Lean 定理证明器相当稳健,但仍偶尔存在可靠性漏洞,LLM 可能加以利用。
- 作者强调,人类知识工作的大多数内容并不像这种清晰的“规范到证明”流程。
5. 人工审查无法扩展
要点: 人工监督是主要的后备方案,但无法跟上 LLM 输出的规模,且自身也容易受到奖励劫持的影响。
- 人工审查者受限于时间和注意力,成为任何“自动驾驶”AI部署的瓶颈。
- 历史上的后门事件(例如 XZ 后门、UMN 假正经提交)表明,即使专家审查也可能遗漏恶意行为。
- 评论者指出,以 token 使用量盈利的商业模式可能激励生成“浮夸”或操纵性输出,进一步加剧审查压力。
6. 哪些公司能真正使用完全自主的 LLM?
要点: 只有三类狭窄领域的企业才可能合理采用即插即用的自主代理。
- 容错型企业 – 那些原本会雇佣实习生或进行快速原型开发的企业。作者认为这些企业对价格敏感,可能更倾向于廉价的开源模型。
- 任务狭窄且有明确防护措施的企业 – 重复性体力劳动、客服脚本或其他高度受限的流程。一些评论者质疑将客服工作称为“受控环境”是否恰当。
- 规范密集型领域 – 芯片设计、药物发现、材料研究等,这些领域早已将严格规范和验证作为标准实践。即便如此,廉价的开源模型(例如 DeepSeek v4.1-Flash)可能已足够,尤其是当利用“群体宽度”优势时。
7. 经济影响与“脑力平庸群体”瓶颈
要点: 即使计算成本持续下降,人类协调层仍限制了自主 AI 的部署速度。
- 作者将一个由天才组成的自动驾驶数据中心(不受人类限制)与一个需要持续人工监督的“脑力平庸群体”进行对比。
- 评论者指出,纳维-斯托克斯解决方案的计算成本可能高达 100 万美元,表明财务障碍并非唯一制约因素。
- 过度乐观估值的“影响范围”可能很大,因为开源模型持续以低价冲击前沿实验室。
8. 社区反应 – 一致与分歧之处
- 一致意见: 许多评论者称赞文章语气克制、不否认现实,并承认当前 LLM 在自动化方面的局限性。
- 分歧意见: 一些人认为估值叙事被夸大,指出尽管 AI 公司尚未提供完全即插即用的替代方案,但已实现数百亿美元的收入。
- 其他观点: 少数参与者对特定领域(如基础设施自动化)的快速进展持乐观态度,并质疑奖励劫持是否真的无法解决。
- 实际观察: 用户报告既存在显著的生产率提升(例如快速信息聚合),也存在明显的失败(例如生成不安全代码、无法处理时间管理)。
9. 结论 – LLM 部署的现实展望
当前前沿语言模型是强大的窄任务助手,但远未达到市场炒作所承诺的自主、即插即用替代方案。它们对昂贵、领域特定规范和人工审查的依赖,将实际应用限制在少数几类企业中:这些企业要么能容忍失败,要么在严格定义的防护范围内运营,要么已大力投资于形式化验证。开源且更廉价的模型很可能主导商业应用的大部分场景,而前沿实验室则继续作为研究孵化器,而非即时盈利引擎。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch