xAI Grok 4.1 發佈說明
xAI 已發佈 Grok 4.1,透過增強的情緒智力、創意寫作能力以及減少事實幻覺,提升了現實世界的可用性。該模型現在已向所有在 grok.com 的使用者開放,以及相關的 iOS 和 Android 應用程式。
最先進的通用能力
Grok 4.1 在盲測人類偏好評估中建立了新的基準,特別是在 LMArena Text Leaderboard 上。該模型有兩種主要的配置方式:
- Grok 4.1 Thinking (代號:
quasarflux): 這是推理模型,以 1483 Elo 獲得總排名第 1 的位置,領先最高的非 xAI 模型 31 分。 - Grok 4.1 Non-Reasoning (代號:
tensor): 此版本不使用思考標記 (thinking tokens) 以進行即時回應,總排名第 2,Elo 為 1465。值得注意的是,Grok 4.1 的非思考版本在公開排行榜上的表現優於其他所有模型的完整推理配置。
與之前的生產模型相比,在 2025 年 11 月 1 日至 11 月 14 日期間進行靜默發佈期間的盲測成對評估中,Grok 4.1 在 64.78% 的情況下被偏好。
技術優化與方法論
xAI 利用了與驅動 Grok 4 的相同大規模強化學習 (RL) 基礎設施來優化模型的風格、個性、幫助性與對齊。為了處理不可驗證的獎勵信號,xAI 開發了新方法,使用前沿的代理推理模型 (agentic reasoning models) 作為獎勵模型,以大規模地自主評估並迭代回應內容。
情緒智力與創意寫作
Grok 4.1 使用 EQ-Bench3 和 Creative Writing v3 基準測試來評估人際關係能力與創意輸出:
- EQ-Bench3: 這種由 LLM 判定的測試評估了 45 個角色扮演場景中的主動情緒智力、同理心與人際技能。評估是使用預設採樣參數並以 Claude Sonnet 3.7 作為指定的判別器進行的。
- Creative Writing v3: 此基準測試透過三次迭代,使用評分標準與模型對戰歸一化 Elo 分數,來衡量 32 個不同寫作提示詞的表現。
減少事實幻覺
xAI 在 Grok 4.1 的後訓練階段專注於減少資訊搜尋類提示詞的事實幻覺。這特別針對使用搜尋工具但可能受限於推理深度不足的快速、非推理模型。
評估是在來自生產流量與 FActScore 公開基準測試(500 個傳記問題)的現實世界資訊搜尋查詢分層樣本上進行的。幻覺率被定義為模型回應中具有重大或輕微錯誤的原子主張 (atomic claims) 百分比的宏觀平均值。這些評估是使用配備網路搜尋工具的非推理模型進行的。
Sources
- OriginalGrok 4.1
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch