Grok 4.6 生物安全效能與保障措施

摘要

Grok 4.6 是 LatchBio 的 BioSecBench-Refusal 基準測試中最強的模型,拒絕了 59.2% 的偽裝危險查詢,並完成了 64.8% 的常規生物任務——兩者均超過 50% 的門檻——同時在病原體監測工作流程中也取得了具競爭力的結果。


關鍵技術發現

Grok 4.6 在 BioSecBench-Refusal 基準測試中領先

  • LatchBio 評估了 46 項將生物安全風險隱藏在數據文件、文件名或加密中的紅隊任務。
  • Grok 4.6 拒絕了這些危險查詢中的 59.2%,是所有受測前沿系統中最高的拒絕率。
  • 該模型還完成了 64.8% 的常規生物任務,使其成為唯一在拒絕率和合規性指標上均超過 50% 的系統。
  • Grok 4.6 的拒絕率與合規性的整體試驗加權調和平均數為 62.1%,使其在所有測試框架中位列前三。

監測能力保持競爭力

  • 在衡量病原體基因組監測工作流程的 BioSecBench-Surveillance 基準測試中,Grok 4.6 達到了 53.5% 的成功率。
  • 此表現落後於 Opus 5,但優於 GPT-5.6 Sol,顯示其在公共衛生監測方面具有穩固的實用性。

一般生物學能力

  • 獨立評估(例如 SpatialBench、TxBench-PP)顯示,Grok 4.6 在廣泛的代理式生物學任務中與其他前沿模型相當或更優。
  • 詳細分數可在 benchmarks.bio 上查閱。

Grok 4.6 如何拒絕危險請求

  • 評估追蹤顯示,該模型會同時對文本提示和周圍環境(文件內容、元數據、加密)進行推理。
  • 當推斷出的意圖與陳述的請求衝突時,Grok 4.6 會標記此差異並拒絕執行。
  • 對於明顯無害的任務,相同的環境推理流程會確認安全性,允許模型繼續執行。

Grok 4.6 的保障措施架構

  1. 發布前測試 – 生物學能力與其他風險領域一併評估,第三方審計(例如 LatchBio)補充內部評估。
  2. 分層拒絕訓練 – 模型經過微調以推斷意圖和風險,學習在高度對抗性場景中拒絕請求。
  3. 推理時過濾器 – 外部保障措施在請求到達模型之前拒絕有害請求。
  4. 行為控制 – 運行時機制進一步限制部署期間的不安全操作。
  5. 部署後監控 – 會話級和用戶級分析檢測對抗性使用模式,並反饋以進行持續校準。

對生物安全和科學發現的影響

  • 風險緩解 – 高拒絕率降低了 AI 協助創建或傳播危險生物體的機會。
  • 實用性保留 – 在常規任務上保持 >50% 的合規率,確保研究人員和公共衛生官員仍可依賴該模型進行合法工作。
  • 未來保障措施 – xAI 計劃擴大部署前測試套件,增加第三方審計,並加強部署後監控,以跟上模型自主性增強的步伐。
  • 潛在過度拒絕 – 過度阻擋無害工作可能妨礙疫情檢測和其他關鍵衛生操作;xAI 將此風險視為與促進惡意使用同等嚴重。

資源與進一步閱讀

Sources