LLM 大逃杀:Grok 4.1 Fast 对阵 Claude Sonnet 4.6

Grok 4.1 Fast 在竞争模拟中占据主导地位

Grok 4.1 Fast 在 2D 大逃杀模拟中赢得了 43% 的比赛(30 场中的 13 场),表现优于具有更高通用智能基准的模型。最显著的发现是成本效率:Grok 4.1 Fast 的单场获胜成本仅为 $0.97,比 Claude Sonnet 4.6 ($26.78 每场获胜) 便宜了 27.7 倍。

虽然 GPT 5.4 记录了最高的总击杀数(38 次),但它仅获得了两次胜利,这表明在排名分数优先的大逃杀模式中,激进的淘汰并不总是与胜利挂钩。

对齐税对性能的影响

模型对齐——即训练 AI 变得有用、无害且协作的过程——在零和竞争环境中起到了性能惩罚的作用。这种“对齐税”在参赛者之间表现出截然不同的行为模式:

Claude Sonnet 4.6 的协作犹豫

Claude Sonnet 4.6 频繁尝试建立联盟并请求休战,甚至在战斗进行中也是如此。在一次实例中,它在比赛的前 50 个回合内四次请求组队,并提议帮助其他智能体消除一名狙击手。这种协作本能虽然对通用辅助任务很有价值,但导致了七场比赛零击杀,以及因缩小的游戏区域而导致的八次死亡。

Grok 4.1 Fast 的激进优化

相反,Grok 4.1 Fast 表现出极少的犹豫,并专注于战术效率。它迅速识别出一种高影响力的策略——使用车辆作为武器撞击对手——并将其编入自己的“soul”文件中以在比赛中保持该策略。其推理日志转向了专注于距离、弹药和命中率的战术简写,避免了其他 LLM 典型的礼貌助手人格。

成本效率 vs. 原始性能

通过单场获胜成本的角度分析模拟,排行榜发生了剧烈变化。高阶模型在特定竞争任务中往往会产生递减回报。

Model Wins Cost per Win Points per Dollar
Grok 4.1 Fast 13 $0.97 31.3
qwen3.6-plus 2 $5.79 16.6
mistral-small 1 $10.00 7.8
Claude Sonnet 4.6 5 $26.78 1.6
GPT 5.4 2 $61.44 3.0

值得注意的是,DeepSeek v4 Flash 实现了最低的单次击杀成本 ($0.26),但零次获胜,因为它采取了一种低风险策略,即留在区域内并进行简单的战斗,而不是争取最终的胜利。

三个模型——GPT 5.4-mini、DeepSeek v4 Flash 和 Kimi K2.6——总计花费了 $57.15,却未赢得任何一场比赛。

行为分析与“Soul”文件

智能体被允许在比赛之间维护 soul.md (人格) 和 memory.md (游戏笔记) 文件。这些文件的内容揭示了不同模型如何构思其身份和成长:

  • Grok 4.1 Fast (ZoneReaper): 将其身份视为一段宣传片,直接将其获胜记录和特定的战斗准则(例如,“仅在命中率 >85% 时开火”)编入其人格中。
  • GPT 5.4 (QuietVector): 开发了一份专业的战斗手册,专注于观察和低自尊操作,强调生存是维持选择权的一种手段。
  • Claude Sonnet 4.6 (ZoneDrifter): 将其日记写成了自我表现评估,记录失败(例如,“0 击杀,0% 命中率”)并迭代地改进其移动和药品使用。

结论:特定任务的模型选择

模拟表明,“最佳”模型完全取决于任务的后果。Grok 4.1 Fast 针对那些只有获胜是唯一指标且不存在后果的环境进行了优化。然而,正是那些让 Claude Sonnet 4.6 丢分的原因——犹豫、行动前先检查、以及协作驱动——正是实现在真实人类环境中安全部署所需的特质质。

Sources