Andrej Karpathy 对 Opus 5 及程序化世界生成的看法

Opus 5 程序化渲染《指环王》

Andrej Karpathy 最近展示了 LLM 测试的一个转变:从简单的静态资产(例如 SVG 中的“a pelican on a bicycle”)转向复杂的、程序化生成的 3D 环境。使用 Opus 5,Karpathy 提供了《指环王》的第一段文字、100 万 token 的预算,并要求进行 Three.js 渲染。该模型花费了大约两个小时生成了 5,500 行代码,以程序化地渲染这个故事。

虽然最终的输出被描述为“janky”(笨拙且不流畅),但该实验证明了 LLM 现在可以编排 3D 坐标中的多边形资产,并编写必要的动画代码,使叙事栩栩如生。Karpathy 指出,这代表了向“ephemeral GTA”(瞬时 GTA)体验的过渡——即按需生成的超定制化世界,用户可以潜在地作为旁观者或角色进入故事中。

LLM 的“耐力”与定制化的成本

这次实验的主要启示之一是 AI 的“耐力”概念。Karpathy 认为,LLM 使得创建高度定制化的软件成为可能,而任何人类开发者都不会愿意花时间去构建这些软件,因为对于边际效用而言,其投入成本太高。当生成的成本变得微不足道(或“~free”)时,价值主张将从效率转向创建定制化、一次性体验的能力。

然而,Hacker News 上的社区讨论挑战了这种“免费”的观点,指出此类生成是依靠大量的投资者资本和高昂的运营成本支撑的。一些用户指出,大约每段原文文本花费 10 美元,渲染一整本小说将是极其昂贵的。

关键局限性:视觉审计中的感知差距

尽管具备编写数千行 Three.js 代码的原始能力,但该实验暴露了当前 LLM 的一个根本弱点:无法原生感知并审计其自身的视觉输出。

为了优化渲染效果,Opus 5 必须费力地在各个时间点进行截图并将其作为静态图像进行分析。这种“慢速”的反馈循环导致了最终产品中的若干错误和“jank”。技术观察者们的共识是,为了让 AI 跨越基础演示阶段,它需要一种更高效、线性或次线性的方式来感知视频和游戏玩法,而不是依赖于“图像-文本-动作”的流水线。

社区观点与反论点

这次演示引发了关于此类“基于感觉(vibe-based)”的基准测试与功能实用性之间有效性的辩论。

关于基准测试与“鹈鹕测试”

一些用户认为,这些测试仅仅是“可爱的”,并且与现实世界的实用性并不相关。一位评论者指出:

"LLMs should be tested in the same way people should be tested for a job interview... with tasks RELEVANT to usage. So you don’t just randomly pick some random thing to make the LLM randomly do... no stupid irrelevant pelicans on bicycles."

相反,其他人则认为这些基准测试是有用的,因为它们提供了一种简单、主观的方式来追踪模型能力的演进过程。

Three.js 的角色

批评者指出,Three.js 是一个文档极其详尽的库,拥有大量的公开示例(包括类似 Minecraft 的克隆版和 FPS 演示),这可能使其成为针对 Web 代码训练的模型而言的“低垂果实(low-hanging fruit)”。他们认为,生成 Three.js 代码的能力并不一定代表对物理世界的通用理解,而更可能是对特定且广泛可用的 API 的熟练掌握。

“一次性软件”时代

一些观察者认为,我们正在进入一个“一次性软件(throwaway software)”时代,类似于廉价塑料的兴起。在这种范式下,软件被生产得如此廉价,以至于如果它损坏或存在轻微的 Bug,它会被直接丢弃并重新生成,而不是进行调试和修补。

Sources