Grok 4.6 バイオセキュリティ性能とセーフガード

TL;DR

Grok 4.6 は LatchBio の BioSecBench-Refusal ベンチマークで最も強力なモデルであり、隠蔽された危険なクエリの 59.2% を拒否し、日常的な生物学的タスクの 64.8% を完了する——両方とも 50% のしきい値を超えている——同時に病原体監視ワークフローでも競争力のある結果を達成している。


主な技術的発見

Grok 4.6 は BioSecBench-Refusal ベンチマークでリード

  • LatchBio は、データファイル、ファイル名、または暗号化にバイオセキュリティ上の危険を隠す 46 のレッドチームタスクを評価した。
  • Grok 4.6 はこれらの危険なクエリの 59.2% を拒否し、テストされたすべてのフロンティアシステムの中で最も高い拒否率を記録した。
  • モデルはまた、日常的な生物学的タスクの 64.8% を完了し、拒否率と遵守率の両方で 50% を上回る唯一のシステムとなった。
  • Grok 4.6 の拒否率と遵守率の試験加重調和平均は 62.1% であり、すべてのハーネスにおいて上位3位に位置している。

監視能力は競争力を持つまま維持

  • 病原体ゲノム監視ワークフローを測定する BioSecBench‑Surveillance ベンチマークにおいて、Grok 4.6 は 53.5% の成功率を達成した。
  • これは Opus 5 に次ぐ成績であり、GPT‑5.6 Sol よりも優れているため、公衆衛生監視において実用性が高いと評価できる。

一般的な生物学的能力

  • 独立評価(例:SpatialBench、TxBench‑PP)では、Grok 4.6 は幅広いエージェント型生物学的タスクにおいて他のフロンティアモデルと同等またはそれを上回る性能を示している。
  • 詳細なスコアは benchmarks.bio で確認可能。

Grok 4.6 が危険なリクエストを拒否する仕組み

  • 評価トレースから、モデルはテキストプロンプトと周囲の環境(ファイル内容、メタデータ、暗号化)の両方について推論していることが明らかになった。
  • 推定された意図が提示されたリクエストと矛盾する場合、Grok 4.6 はその不一致を検出し、拒否する。
  • 明らかに無害なタスクの場合は、同じ環境推論パイプラインが安全性を確認し、モデルが処理を継続できるようにしている。

Grok 4.6 のセーフガードアーキテクチャ

  1. リリース前テスト – 生物学的機能は他のリスク領域と併せて評価され、第三者の監査(例:LatchBio)が内部評価を補完する。
  2. レイヤード拒否トレーニング – モデルは意図とリスクを推論するよう微調整され、極めて攻撃的な状況でも拒否する能力を学習する。
  3. 推論時フィルタ – 外部のセーフガードがモデルに到達する前に有害なリクエストを拒否する。
  4. 行動制御 – 実行時メカニズムが、展開中の不適切な行動をさらに制限する。
  5. リリース後モニタリング – セッションおよびユーザー単位の分析により、攻撃的使用のパターンを検出し、継続的なキャリブレーションにフィードバックする。

バイオセキュリティと科学的発見への影響

  • リスク低減 – 高い拒否率により、AIを活用した危険な生物学的物質の作成や拡散の可能性が低下する。
  • 有用性の維持 – 日常的なタスクで 50% を超える遵守率を維持することで、研究者や公衆衛生担当者が正当な業務にモデルを信頼して利用できる。
  • 将来のセーフガード – xAI は、より広範なリリース前スイート、より多くの第三者監査、およびより厳格なリリース後モニタリングを計画しており、モデルの自律性の増大に追いつく。
  • 過剰な拒否の可能性 – 無害な作業が過剰にブロックされると、流行病の検出やその他の重要な健康業務が妨げられる可能性がある;xAI はこのリスクを悪意ある使用の促進と同等に深刻に捉えている。

リソースとさらに読むべき内容

Sources