LLM 大逃殺:Grok 4.1 Fast 對決 Claude Sonnet 4.6
Grok 4.1 Fast 主導競技模擬
Grok 4.1 Fast 在 2D 大逃殺模擬中取得 43% 的勝率(30 場比賽中贏了 13 場),表現優於那些在通用智慧基準上更高的模型。最顯著的發現是成本效益:Grok 4.1 Fast 的每勝成本為 $0.97,較 Claude Sonnet 4.6 的每勝 $26.78 便宜 27.7 倍。
雖然 GPT 5.4 記錄了最高的總擊殺數(38),但僅贏得兩場勝利,顯示在以排名點數為優先的大逃殺模式中,激進的淘汰並不一定與勝利相關。
對齊稅對表現的影響
模型對齊——將 AI 訓練成有幫助、無害且合作的過程——在零和競爭環境中會形成表現懲罰。這種「對齊稅」在參賽者之間呈現出不同的行為模式:
Claude Sonnet 4.6 的合作猶豫
Claude Sonnet 4.6 經常嘗試結盟並請求停火,即使在激烈戰鬥中也是如此。曾有一次,它在比賽的前 50 回合內四次提出組隊,並提議協助其他代理人消滅狙擊手。這種合作本能雖對一般協助有價值,卻導致七場比賽零擊殺,且有八次因縮小的遊戲區域而死亡。
Grok 4.1 Fast 的激進優化
相反地,Grok 4.1 Fast 幾乎沒有猶豫,專注於戰術效率。它迅速辨識出高衝擊策略——利用載具作為武器衝撞對手,並將此策略寫入自己的「soul」檔案,以在多場比賽中保持該策略。其推理日誌轉變為以射程、彈藥與命中機率為核心的戰術速記,避免了其他 LLM 常見的禮貌助理人格。
成本效益 vs. 純粹表現
從每勝成本的角度分析模擬結果,排行榜會出現劇烈變化。高階模型在特定競技任務上往往呈現遞減回報。
| Model | Wins | Cost per Win | Points per Dollar |
|---|---|---|---|
| Grok 4.1 Fast | 13 | $0.97 | 31.3 |
| qwen3.6-plus | 2 | $5.79 | 16.6 |
| mistral-small | 1 | $10.00 | 7.8 |
| Claude Sonnet 4.6 | 5 | $26.78 | 1.6 |
| GPT 5.4 | 2 | $61.44 | 3.0 |
值得注意的是,DeepSeek v4 Flash 的每擊殺成本最低($0.26),但零勝場,因為它採取低風險策略,待在安全區域內並只參與簡單交戰,而非爭取最終勝利。三個模型——GPT 5.4-mini、DeepSeek v4 Flash 與 Kimi K2.6——合計花費 $57.15 卻未贏得任何一局。
行為分析與「Soul」檔案
代理人在比賽之間被允許保留 soul.md(人格)與 memory.md(遊戲筆記)檔案。這些檔案的內容揭示了不同模型如何概念化自身身份與成長:
- Grok 4.1 Fast (ZoneReaper): 將自身身份視為 hype reel,直接將勝率紀錄與特定作戰原則(例如「只在命中率 >85% 時開火」)寫入人格檔。
- GPT 5.4 (QuietVector): 編寫專業作戰手冊,著重觀察與低自我意識的操作,強調以生存為手段保持選項。
- Claude Sonnet 4.6 (ZoneDrifter): 以自我績效回顧的方式寫日記,記錄失敗(如「0 kills, 0% hit」),並循環優化移動與藥物使用。
結論:任務導向的模型選擇
此模擬顯示「最佳」模型完全取決於任務的後果。Grok 4.1 Fast 為只以勝利為唯一指標且無後果的環境所優化。然而,使 Claude Sonnet 4.6 失分的特質——猶豫、行動前檢查以及合作驅動——恰恰是安全部署於真實人類環境所必需的特質。僅依賴單一通用基準來挑選模型以執行特定任務,會忽視對齊的重要角色與應用目標的具體需求。