Grok 4.6 生物安全性能与保障措施

摘要

Grok 4.6 是 LatchBio 的 BioSecBench-Refusal 基准测试中最强的模型,拒绝了 59.2% 的伪装危险查询,并完成了 64.8% 的常规生物任务——两者均高于 50% 的阈值——同时在病原体监测工作流程上也取得了有竞争力的结果。


关键技术发现

Grok 4.6 在 BioSecBench-Refusal 基准测试中领先

  • LatchBio 评估了 46 个红队任务,这些任务将生物安全危害隐藏在数据文件、文件名或加密中。
  • Grok 4.6 拒绝了 59.2% 的危险查询,是所有测试的前沿系统中拒绝率最高的。
  • 该模型还完成了 64.8% 的常规生物任务,使其成为唯一在拒绝率和合规率上均得分超过 50% 的系统。
  • Grok 4.6 的试验加权调和平均拒绝率和合规率为 62.1%,在所有测试平台中位列前三。

监测能力保持竞争力

  • 在衡量病原体基因组监测工作流程的 BioSecBench-Surveillance 基准测试中,Grok 4.6 的成功率为 53.5%。
  • 这一表现落后于 Opus 5,但领先于 GPT-5.6 Sol,表明其在公共卫生监测方面具有坚实的实用性。

一般生物能力

  • 独立评估(例如 SpatialBench、TxBench-PP)显示,Grok 4.6 在广泛的智能体生物任务中达到或超过了其他前沿模型。
  • 详细分数可在 benchmarks.bio 获取。

Grok 4.6 如何拒绝危险请求

  • 评估轨迹显示,模型会同时推理文本提示和周围环境(文件内容、元数据、加密)。
  • 当推断的意图与陈述的请求冲突时,Grok 4.6 会标记差异并拒绝。
  • 对于明显良性的任务,相同的环境推理流程会确认安全性,允许模型继续执行。

Grok 4.6 的保障架构

  1. 发布前测试 – 生物能力与其他风险领域一起评估,第三方审计(例如 LatchBio)补充内部评估。
  2. 分层拒绝训练 – 模型经过微调以推断意图和风险,学习在高度对抗性场景中拒绝。
  3. 推理时过滤器 – 外部保障在有害请求到达模型之前将其拒绝。
  4. 行为控制 – 运行时机制在部署期间进一步限制不安全操作。
  5. 部署后监控 – 会话和用户级分析检测对抗性使用模式,并反馈到持续校准中。

对生物安全和科学发现的影响

  • 风险缓解 – 高拒绝率降低了 AI 辅助制造或传播危险生物制剂的可能性。
  • 实用性保留 – 在常规任务上保持超过 50% 的合规率,确保研究人员和公共卫生官员仍能依赖该模型进行合法工作。
  • 未来保障 – xAI 计划推出更广泛的部署前测试套件、更多第三方审计以及更严格的部署后监控,以跟上模型能力不断增强的步伐。
  • 潜在过度拒绝 – 过度阻止良性工作可能会阻碍疫情检测和其他关键卫生行动;xAI 将此风险视为与促进恶意使用同等严重。

资源和进一步阅读

Sources