LLM 大逃杀:Grok 4.1 Fast 对阵 Claude Sonnet 4.6
Grok 4.1 Fast 在竞争模拟中占据主导地位
Grok 4.1 Fast 在 2D 大逃杀模拟中赢得了 43% 的比赛(30 场中的 13 场),表现优于具有更高通用智能基准的模型。最显著的发现是成本效率:Grok 4.1 Fast 的单场获胜成本仅为 $0.97,比 Claude Sonnet 4.6 ($26.78 每场获胜) 便宜了 27.7 倍。
虽然 GPT 5.4 记录了最高的总击杀数(38 次),但它仅获得了两次胜利,这表明在排名分数优先的大逃杀模式中,激进的淘汰并不总是与胜利挂钩。
对齐税对性能的影响
模型对齐——即训练 AI 变得有用、无害且协作的过程——在零和竞争环境中起到了性能惩罚的作用。这种“对齐税”在参赛者之间表现出截然不同的行为模式:
Claude Sonnet 4.6 的协作犹豫
Claude Sonnet 4.6 频繁尝试建立联盟并请求休战,甚至在战斗进行中也是如此。在一次实例中,它在比赛的前 50 个回合内四次请求组队,并提议帮助其他智能体消除一名狙击手。这种协作本能虽然对通用辅助任务很有价值,但导致了七场比赛零击杀,以及因缩小的游戏区域而导致的八次死亡。
Grok 4.1 Fast 的激进优化
相反,Grok 4.1 Fast 表现出极少的犹豫,并专注于战术效率。它迅速识别出一种高影响力的策略——使用车辆作为武器撞击对手——并将其编入自己的“soul”文件中以在比赛中保持该策略。其推理日志转向了专注于距离、弹药和命中率的战术简写,避免了其他 LLM 典型的礼貌助手人格。
成本效率 vs. 原始性能
通过单场获胜成本的角度分析模拟,排行榜发生了剧烈变化。高阶模型在特定竞争任务中往往会产生递减回报。
| Model | Wins | Cost per Win | Points per Dollar |
|---|---|---|---|
| Grok 4.1 Fast | 13 | $0.97 | 31.3 |
| qwen3.6-plus | 2 | $5.79 | 16.6 |
| mistral-small | 1 | $10.00 | 7.8 |
| Claude Sonnet 4.6 | 5 | $26.78 | 1.6 |
| GPT 5.4 | 2 | $61.44 | 3.0 |
值得注意的是,DeepSeek v4 Flash 实现了最低的单次击杀成本 ($0.26),但零次获胜,因为它采取了一种低风险策略,即留在区域内并进行简单的战斗,而不是争取最终的胜利。
三个模型——GPT 5.4-mini、DeepSeek v4 Flash 和 Kimi K2.6——总计花费了 $57.15,却未赢得任何一场比赛。
行为分析与“Soul”文件
智能体被允许在比赛之间维护 soul.md (人格) 和 memory.md (游戏笔记) 文件。这些文件的内容揭示了不同模型如何构思其身份和成长:
- Grok 4.1 Fast (ZoneReaper): 将其身份视为一段宣传片,直接将其获胜记录和特定的战斗准则(例如,“仅在命中率 >85% 时开火”)编入其人格中。
- GPT 5.4 (QuietVector): 开发了一份专业的战斗手册,专注于观察和低自尊操作,强调生存是维持选择权的一种手段。
- Claude Sonnet 4.6 (ZoneDrifter): 将其日记写成了自我表现评估,记录失败(例如,“0 击杀,0% 命中率”)并迭代地改进其移动和药品使用。
结论:特定任务的模型选择
模拟表明,“最佳”模型完全取决于任务的后果。Grok 4.1 Fast 针对那些只有获胜是唯一指标且不存在后果的环境进行了优化。然而,正是那些让 Claude Sonnet 4.6 丢分的原因——犹豫、行动前先检查、以及协作驱动——正是实现在真实人类环境中安全部署所需的特质质。