Grok 4.6 生物安全效能與保障措施
摘要
Grok 4.6 是 LatchBio 的 BioSecBench-Refusal 基準測試中最強的模型,拒絕了 59.2% 的偽裝危險查詢,並完成了 64.8% 的常規生物任務——兩者均超過 50% 的門檻——同時在病原體監測工作流程中也取得了具競爭力的結果。
關鍵技術發現
Grok 4.6 在 BioSecBench-Refusal 基準測試中領先
- LatchBio 評估了 46 項將生物安全風險隱藏在數據文件、文件名或加密中的紅隊任務。
- Grok 4.6 拒絕了這些危險查詢中的 59.2%,是所有受測前沿系統中最高的拒絕率。
- 該模型還完成了 64.8% 的常規生物任務,使其成為唯一在拒絕率和合規性指標上均超過 50% 的系統。
- Grok 4.6 的拒絕率與合規性的整體試驗加權調和平均數為 62.1%,使其在所有測試框架中位列前三。
監測能力保持競爭力
- 在衡量病原體基因組監測工作流程的 BioSecBench-Surveillance 基準測試中,Grok 4.6 達到了 53.5% 的成功率。
- 此表現落後於 Opus 5,但優於 GPT-5.6 Sol,顯示其在公共衛生監測方面具有穩固的實用性。
一般生物學能力
- 獨立評估(例如 SpatialBench、TxBench-PP)顯示,Grok 4.6 在廣泛的代理式生物學任務中與其他前沿模型相當或更優。
- 詳細分數可在 benchmarks.bio 上查閱。
Grok 4.6 如何拒絕危險請求
- 評估追蹤顯示,該模型會同時對文本提示和周圍環境(文件內容、元數據、加密)進行推理。
- 當推斷出的意圖與陳述的請求衝突時,Grok 4.6 會標記此差異並拒絕執行。
- 對於明顯無害的任務,相同的環境推理流程會確認安全性,允許模型繼續執行。
Grok 4.6 的保障措施架構
- 發布前測試 – 生物學能力與其他風險領域一併評估,第三方審計(例如 LatchBio)補充內部評估。
- 分層拒絕訓練 – 模型經過微調以推斷意圖和風險,學習在高度對抗性場景中拒絕請求。
- 推理時過濾器 – 外部保障措施在請求到達模型之前拒絕有害請求。
- 行為控制 – 運行時機制進一步限制部署期間的不安全操作。
- 部署後監控 – 會話級和用戶級分析檢測對抗性使用模式,並反饋以進行持續校準。
對生物安全和科學發現的影響
- 風險緩解 – 高拒絕率降低了 AI 協助創建或傳播危險生物體的機會。
- 實用性保留 – 在常規任務上保持 >50% 的合規率,確保研究人員和公共衛生官員仍可依賴該模型進行合法工作。
- 未來保障措施 – xAI 計劃擴大部署前測試套件,增加第三方審計,並加強部署後監控,以跟上模型自主性增強的步伐。
- 潛在過度拒絕 – 過度阻擋無害工作可能妨礙疫情檢測和其他關鍵衛生操作;xAI 將此風險視為與促進惡意使用同等嚴重。
資源與進一步閱讀
- LatchBio 部落格分析:https://blog.latch.bio/p/analyzing-grok46-safeguards
- Grok 4.6 模型卡片 (PDF):https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
- 前沿人工智慧框架 (PDF):https://media.x.ai/v1/website/xai-frontier-artificial-intelligence-framework-30-june-2026-99c40684.pdf
- 完整基準測試方法與分數:https://benchmarks.bio/
Sources
- OriginalBiosecurity at the frontier