Hacker News Goalposts: Tracking AI Progress and the Moving Target of AGI

追求人工通用智能(AGI)常常表现出一种「移动目标」现象,即曾经被认为不可能的能力如今已变得司空见惯,导致观察者不断重新定义成功标准。最近一个由社区发起的项目「Goalposts」,汇集了 Hacker News 用户设定的历史挑战,凸显了这一演变过程,以及模型完成某项任务一次与可靠完成该任务之间的持续差距。

AI基准测试的演变

AI基准测试已从简单的数字任务转向复杂的现实世界交互。对2016年至2026年挑战的分析显示,社区对「困难」问题的定义发生了明显转变:

  • 早期挑战(2016–2024): 主要集中在图灵测试、基础软件工程和简单代理行为(例如「帮我订杯咖啡」)。
  • 近期挑战(2026): 转向物理世界交互(例如「打开一扇实体门」)、高级认知共情(「令人信服地模仿人类的小气」)以及基础科学发现(「实现全新的科学突破」)。

这一转变表明,尽管数字模仿和代码生成在很大程度上已被视为已解决,但AI进展的前沿已转向世界建模和自主物理代理能力。

可靠性与随机成功之间的区别

一个关键的区分已浮现:模型通过蛮力计算实现结果的能力,与它可靠完成任务的能力之间的差异。

"在许多情况下,我确信,只要拥有无限的计算资源和无限的尝试次数,当前的LLM至少可以完成一次该任务……但其中一些并非常规发生,或者模型目前无法可靠地完成该任务。"

这种差距在多个具体失败模式中表现明显:

  • 空间推理: 尽管投票数高暗示成功,用户报告称前沿模型(如 Opus 5.5 和 5.6 Luna)在处理ASCII艺术时仍存在困难,经常错误识别简单形状(例如将脚误认为机车)。
  • 领域特定专长: 尽管LLM在编程方面因训练数据量庞大而表现出色,但在农业、建筑、机械等专业物理领域常出现失败,可能提供「灾难性」建议或虚构来源。
  • 上下文细微差别: AI工具在需要类人直觉的任务中仍存在困难,例如通过推断玩家水平来纠正棋谱中的错误走法。

自动驾驶所需的「世界模型」

最具争议的目标之一是完全解决自动驾驶汽车问题。一些技术观察者认为,自动驾驶无法仅通过模式识别解决,而需要一个根本性的「世界模型」来进行预测。

该论点认为,区分一个无害物体(空汽水罐)和一个关键危险(砖块)需要具备通用智能(AGI中的「G」)来预测结果并避免失败。没有全面的世界模型,AI无法可靠应对物理世界的不可预测性。

重新定义图灵测试

社区对图灵测试的看法已从二元的通过/失败,演变为对人类感知的细致讨论。一些人认为该测试本质上存在缺陷,因为人类往往无法区分一个复杂的「鹦鹉」和一个有意识的存在,使得测试衡量的是人类的易骗性,而非AI的智能水平。

此外,现在已区分标准图灵测试与「对抗性」图灵测试,后者要求模型在长时间高强度审查下维持人类身份,许多人认为这一标准至今仍未达成。

Sources

相关