xAI Grok 4.1 发布说明

xAI 已发布 Grok 4.1,通过增强的情绪智能、创意写作能力以及减少事实幻觉,提升了现实世界中的可用性。该模型现已向 grok.com 上的所有用户开放,以及相关的 iOS 和 Android 应用程序。

最先进的通用能力

Grok 4.1 在盲测人类偏好评估中建立了新的基准,特别是在 LMArena Text Leaderboard 上。该模型有两种主要配置:

  • Grok 4.1 Thinking (代码名称: quasarflux): 这一推理模型以 1483 Elo 的得分占据总榜第 1 位,领先最高的非 xAI 模型 31 分。
  • Grok 4.1 Non-Reasoning (代码名称: tensor): 此版本不使用思考标记 (thinking tokens) 进行即时响应,总榜排名第 2 位,Elo 为 1465。

值得注意的是,Grok 4.1 的非思考版本在公开排行榜上超越了所有其他模型的全推理配置。

与之前的生产模型相比,在 2025 年 11 月 1 日至 11 月 14 日期间进行静默推广期间进行的盲测成对评估中,Grok 4.1 在 64.78% 的情况下被选中。

技术优化与方法论

xAI 利用了与驱动 Grok 4 相同的规模化强化学习 (RL) 基础设施来优化模型的风格、个性、帮助性和对齐性。为了处理不可验证的奖励信号,xAI 开发了新方法,使用前沿的代理推理模型 (agentic reasoning models) 作为奖励模型,以大规模地自主评估并迭代响应内容。

情绪智能与创意写作

Grok 4.1 使用 EQ-Bench3 和 Creative Writing v3 基准测试进行了评估,以衡量其人际交往能力和创意输出:

  • EQ-Bench3: 这一由 LLM 评判的测试通过 45 个角色扮演场景评估主动情绪智能、共情能力和人际交往技能。评估是使用默认采样参数并以 Claude Sonnet 3.7 作为指定的评判者进行的。
  • Creative Writing v3: 该基准测试通过三次迭代,使用评分标准和模型对战归一化 Elo 分数,衡量 32 个不同写作提示词下的表现。

减少事实幻觉

xAI 在 Grok 4.1 的训练后阶段专注于减少信息寻求类提示词的事实幻觉。这特别针对那些使用搜索工具但可能存在推理深度有限的快速、非推理模型。

评估是在来自生产流量的现实世界信息寻求查询和 FActScore 公开基准测试(500 个传记问题)的分层样本上进行的。幻觉率被定义为模型响应中具有重大或轻微错误的原子声明 (atomic claims) 百分比的宏观平均值。这些评估是使用配备了网络搜索工具的非推理模型进行的。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch